本文へ移動
AOIFUTURE / NEWS

EDITION

ROLLING EDITION

AOIFUTURE News — エージェント障害を「検知」で終わらせない

実行中の失敗を見つけて巻き戻す仕組みと、複数セッションに分散した能力蓄積を追う仕組みは、別々の安全境界として設計する必要がある。

Published
Selection snapshot observed at
Signals
2 / finite

SOURCE-FIRST SIGNALS

Signals

PAPER arxiv.org LEAD NEW

実行時の障害検知を、検証・巻き戻し・再実行まで閉じる

Source fact

著者らは2,823件のエージェント実行を用い、学習型監視と決定論的検証を評価した。要旨では、巻き戻しとライブ再実行により障害の45%を回復し、タスク成功率が52%から73%へ上がったと報告している。

Read the direct source Real-Time Detection and Repair of LLM Agent Failures
Why this signal matters

Why selected

障害を見つけるだけでなく、受け取ったツール結果の再計算、必須呼び出しの確認、巻き戻しと再実行を一つの運用ループとして扱っているため。

選定方針

AOI note

監視モデルのスコアだけを公開判断に使わず、決定論的に再計算できる不変条件と、失敗時に戻せる実行境界を組み合わせる。検知率ではなく、誤検知予算、復旧率、再実行コストまで同じ監査記録に残すべきだ。

PAPER arxiv.org MAJOR NEW

無害に見える会話の間で、能力が積み上がる危険を追う

Source fact

論文要旨は、個々には無害に見える複数のセッションで成果物を蓄積し、有害な目的に向けて能力を合成する脅威を述べ、会話をまたいで関連能力を集約する検知方式Magnetを提案する。

Read the direct source Magnet: Detecting Cross-Session AI Misuse Through Capability Accumulation
Why this signal matters

Why selected

単一実行の障害回復では捉えられない、セッションをまたぐ能力蓄積を補助的な脅威モデルとして示すため。

選定方針

AOI note

越境相関は検知機能であると同時に強い監視権限でもある。相関キー、保持期間、閲覧権限、誤結合への異議申立てを定義せず、会話履歴を広く束ねてはならない。

前のEditionを読む