本文へ移動
AOIFUTURE / NEWS

EDITION

ROLLING EDITION

AIの評価・検索・記憶を「信じられる工程」に変える

二重盲検のモデル評価と、自動ファクトチェックの検索限界を深掘り。モデル統制、医療時系列、実行前ガード、長期記憶を短報で追う。

Published
Selection snapshot observed at
Signals
6 / finite

SOURCE-FIRST SIGNALS

Signals

OFFICIAL deepmind.google LEAD NEW

モデル評価を「事前に見せない」仕組みで守る

Source fact

Google DeepMindは、機密ベンチマークを暗号学的な環境に隔離し、モデル提供者が評価内容を事前に見られない二重盲検評価のパイロットを発表した。Gemini Flash Liteを対象に、Singapore AI Safety Institute、OpenMined、AVERI、MLCommonsと検証する。

Read the direct source Piloting the world’s first double-blind AI evaluations
Why this signal matters

Why selected

ベンチマーク汚染を契約だけでなく技術境界でも抑える、評価ガバナンスの具体例になる。

選定方針

AOI note

評価前の秘密保持、実行時の隔離、結果の監査を分け、第三者が再現できる証跡を残す。

PAPER arxiv.org MAJOR NEW

自動ファクトチェックは、検索段階で大きくつまずく

Source fact

著者らは9モデルを4データセットで比較し、最良モデルがSciFactのmacro-F1 0.70からClimateCheckでは0.31へ低下したと報告した。取得証拠を正解注釈へ置き換えると検証精度が14〜22ポイント改善し、検索が主要なボトルネックだと結論づけた。

Read the direct source How Robust Are Automated Fact-Checking Systems? A Cross-Benchmark Evaluation
Why this signal matters

Why selected

検索と真偽判定を一つの精度でまとめず、ドメイン移動時の崩れを測る必要性を示す。

選定方針

AOI note

検索、証拠の質、最終判定を別々に測り、単一ベンチマークの順位を運用品質へ直結させない。

RELEASE github.blog BRIEF NEW

GitHub Copilotのモデル既定方針、段階的な強制へ

Source fact

GitHubはCopilot BusinessとEnterpriseの一般提供モデルに対するglobal model policyの強制を段階的に開始し、9月1日までに展開すると発表した。未設定および新規の一般提供モデルはglobal policyの状態を継承する。

Read the direct source Global model policy generally available
Why this signal matters

Why selected

モデル追加のたびに個別設定が抜ける問題を、組織既定値で抑える変更になる。

選定方針

AOI note

既定値を確認したうえで、例外モデルだけを明示管理し、展開期間中の組織差を監視する。

OFFICIAL research.google BRIEF NEW

GlucoFM、血糖の長短期変動を分けて学習

Source fact

Google Researchは、連続血糖モニタリングの遅い傾向と短期偏差を別ストリームで扱う軽量・自己教師あり基盤モデルGlucoFMを紹介し、糖尿病リスクやインスリン抵抗性など複数の代謝予測へ転用可能だと報告した。

Read the direct source GlucoFM: Foundation model for continuous glucose monitoring
Why this signal matters

Why selected

時系列の異なる変化を分離して表現学習する設計は、医療以外のセンサーデータにも示唆がある。

選定方針

AOI note

臨床導入では、対象集団ごとの外部検証、欠測や機器差、意思決定への影響をモデル性能と分けて確認する。

PAPER arxiv.org BRIEF NEW

StepGuard、ツール実行前に危険な一手を検査

Source fact

著者らはエージェントの各ツール操作を実行前に検査するStepGuardを提案し、AgentDojoとAgentDynで無防御時に比べ平均攻撃成功率を77.3%相対削減、平均utility低下を2.8ポイントに抑えたと報告した。

Read the direct source StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing
Why this signal matters

Why selected

完了後の軌跡監査だけでなく、危険な操作の直前に止める制御を評価できる。

選定方針

AOI note

実環境では許可リスト、承認、ロールバック、監査ログと組み合わせ、未知のツールや文脈での誤検知を測る。

PAPER arxiv.org WATCH NEW

長期タスクの記憶を、失敗証拠から局所更新

Source fact

著者らは作業記憶と経験記憶を結び、実行証拠からSkill Memoryを検証付きで局所更新するRecurisを提案した。4ベンチマーク・10モデルで、完了した37組中35組の成功率が改善したと報告している。

Read the direct source Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
Why this signal matters

Why selected

長い履歴を丸ごと抱える代わりに、現在状態と再利用スキルを分けて改善する設計案になる。

選定方針

AOI note

更新対象を局所化し、変更前後の評価、ロールバック、汚染された経験の隔離を必須にする。

前のEditionを読む