EDITION
ROLLING EDITION
行動を見分ける世界モデルと、防御へ向かう高速AI
Gemini 3.8とWebエージェント世界モデルを深掘り。惑星観測、メタン監視、限定サイバー防御、エージェント安全を短報で追う。
SOURCE-FIRST SIGNALS
Signals
Gemini 3.8 Flash、長期エージェントと防御向けCyber版を投入
Source fact
GoogleはGemini 3.8 Flashと、信頼された防御担当者向けの3.8 Flash Cyberを発表した。Flashは入力100万トークン0.75ドル、出力3.75ドルの導入価格で、HLE-Verified 54.9%と報告。Cyberは20言語の社内脆弱性発見評価で成功率70%超、CWE-Benchでpass@1 47.2%とする。
Why this signal matters
Why selected
高速モデルの競争が、長時間の道具利用と脆弱性発見・修正を同じ基盤で扱う段階へ進んだ。
選定方針AOI note
導入判断では、公開ベンチマークの再現、総トークン量、道具実行の失敗率、修正パッチのレビュー負荷を別々に測る。
Webエージェントの世界モデルを「次状態の再現」から「行動の識別」へ
Source fact
著者らは、候補行動ごとの結果状態を識別させるpredicted-state matchingを提案した。WebArena Go-Browse由来の分岐データで学習し、保持評価、WebPRMBenchの行動順位付け、WebArena-Liteのタスク成功で、教師あり次状態予測を使う比較法を上回ったと報告する。
Why this signal matters
Why selected
エージェントの予測器は「もっともらしい画面」を作るだけでなく、選択肢の差を判別できる必要があるという設計転換を示す。
選定方針AOI note
実務では、予測文の自然さではなく、誤行動を落とせるか、代替行動間の差を保持できるか、追加推論費用に見合うかを評価する。
土星南極に進化中の十角形波、ハッブルが複数年で追跡
Source fact
NASAは、ハッブルの2023年以降の観測から、土星南極を囲む進化中の10辺の大気波を確認したと発表した。南半球で大規模な規則多角形ジェットが観測されたのは初めてで、複数の大気層にまたがるという。
Why this signal matters
Why selected
長期の反復観測が、一枚の画像では捉えにくい惑星大気の形成過程を可視化した。
選定方針AOI note
観測AIでも、単発の検出精度だけでなく、時系列の整合性と観測条件の変化を残すことが重要になる。
衛星画像の深層学習でメタン排出源を世界規模に地図化
Source fact
Google Researchは、NASA EMITのハイパースペクトルデータからメタン濃度、プルーム境界、発生源を推定するMAPL-EMITを公開した。360万の模擬プルームで学習し、専門家注釈で84%の再現率、約1,100グラニュールで約50%多い妥当なプルームを検出したと報告する。
Why this signal matters
Why selected
環境監視で、モデル、データ、推論ライブラリを同時公開し、検出から検証へ進める材料になる。
選定方針AOI note
利用時は信頼度閾値別の見逃しと誤検出、地形別の偏り、現地確認コストを合わせて記録する。
Google、限定参加のサイバー防御制度Fairwind Programを開始
Source fact
Googleは、政府機関と信頼されたパートナー向けの限定アクセス制度Fairwind Programを発表した。Gemini 3.8 Flash CyberとCodeMenderを組み合わせ、脆弱性の発見、検証、修正を支援すると説明している。
Why this signal matters
Why selected
高度なサイバー防御モデルを単体提供ではなく、限定参加、認証、修正ハーネスを含む運用境界として設計した。
選定方針AOI note
導入前に、対象リポジトリ、修正権限、検証環境、レビュー担当、ロールバック条件を分離し、自動修正の速度と誤修正リスクを同時に測る。
エージェントの実行経験からハーネスと方策を共同更新するSafeEvolve
Source fact
SafeEvolveは、完了したオンポリシー軌跡の安全証拠から、安全プロンプトと階層スキルを限定更新し、SFTとRLで方策側も共同改善する枠組みを提案する。Qwen3.5-4BでAgentDojoの攻撃成功率を3分の1にし、良性効用を59.79%から61.86%へ高めたと報告する。
Why this signal matters
Why selected
安全対策を固定ルールかモデル学習の二者択一にせず、監査可能な実行層と方策を分離して更新する研究例になる。
選定方針AOI note
自動更新には、変更単位、ロールバック、評価データ汚染、攻撃成功率と良性効用の同時監視が必要。