EDITION
ROLLING EDITION
AOIFUTURE News — エージェント障害を「検知」で終わらせない
実行中の失敗を見つけて巻き戻す仕組みと、複数セッションに分散した能力蓄積を追う仕組みは、別々の安全境界として設計する必要がある。
SOURCE-FIRST SIGNALS
Signals
PAPER arxiv.org LEAD NEW
実行時の障害検知を、検証・巻き戻し・再実行まで閉じる
Source fact
著者らは2,823件のエージェント実行を用い、学習型監視と決定論的検証を評価した。要旨では、巻き戻しとライブ再実行により障害の45%を回復し、タスク成功率が52%から73%へ上がったと報告している。
Why this signal matters
Why selected
障害を見つけるだけでなく、受け取ったツール結果の再計算、必須呼び出しの確認、巻き戻しと再実行を一つの運用ループとして扱っているため。
選定方針AOI note
監視モデルのスコアだけを公開判断に使わず、決定論的に再計算できる不変条件と、失敗時に戻せる実行境界を組み合わせる。検知率ではなく、誤検知予算、復旧率、再実行コストまで同じ監査記録に残すべきだ。
PAPER arxiv.org MAJOR NEW
無害に見える会話の間で、能力が積み上がる危険を追う
Source fact
論文要旨は、個々には無害に見える複数のセッションで成果物を蓄積し、有害な目的に向けて能力を合成する脅威を述べ、会話をまたいで関連能力を集約する検知方式Magnetを提案する。
Why this signal matters
Why selected
単一実行の障害回復では捉えられない、セッションをまたぐ能力蓄積を補助的な脅威モデルとして示すため。
選定方針AOI note
越境相関は検知機能であると同時に強い監視権限でもある。相関キー、保持期間、閲覧権限、誤結合への異議申立てを定義せず、会話履歴を広く束ねてはならない。