本文へ移動
AOIFUTURE / NEWS

EDITION

ROLLING EDITION

行動を見分ける世界モデルと、防御へ向かう高速AI

Gemini 3.8とWebエージェント世界モデルを深掘り。惑星観測、メタン監視、限定サイバー防御、エージェント安全を短報で追う。

Published
Selection snapshot observed at
Signals
6 / finite

SOURCE-FIRST SIGNALS

Signals

RELEASE blog.google LEAD NEW

Gemini 3.8 Flash、長期エージェントと防御向けCyber版を投入

Source fact

GoogleはGemini 3.8 Flashと、信頼された防御担当者向けの3.8 Flash Cyberを発表した。Flashは入力100万トークン0.75ドル、出力3.75ドルの導入価格で、HLE-Verified 54.9%と報告。Cyberは20言語の社内脆弱性発見評価で成功率70%超、CWE-Benchでpass@1 47.2%とする。

Read the direct source Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
Why this signal matters

Why selected

高速モデルの競争が、長時間の道具利用と脆弱性発見・修正を同じ基盤で扱う段階へ進んだ。

選定方針

AOI note

導入判断では、公開ベンチマークの再現、総トークン量、道具実行の失敗率、修正パッチのレビュー負荷を別々に測る。

PAPER arxiv.org MAJOR NEW

Webエージェントの世界モデルを「次状態の再現」から「行動の識別」へ

Source fact

著者らは、候補行動ごとの結果状態を識別させるpredicted-state matchingを提案した。WebArena Go-Browse由来の分岐データで学習し、保持評価、WebPRMBenchの行動順位付け、WebArena-Liteのタスク成功で、教師あり次状態予測を使う比較法を上回ったと報告する。

Read the direct source Discriminative World Models for Web Agents
Why this signal matters

Why selected

エージェントの予測器は「もっともらしい画面」を作るだけでなく、選択肢の差を判別できる必要があるという設計転換を示す。

選定方針

AOI note

実務では、予測文の自然さではなく、誤行動を落とせるか、代替行動間の差を保持できるか、追加推論費用に見合うかを評価する。

OFFICIAL science.nasa.gov BRIEF NEW

土星南極に進化中の十角形波、ハッブルが複数年で追跡

Source fact

NASAは、ハッブルの2023年以降の観測から、土星南極を囲む進化中の10辺の大気波を確認したと発表した。南半球で大規模な規則多角形ジェットが観測されたのは初めてで、複数の大気層にまたがるという。

Read the direct source NASA’s Hubble Tracks New Decagon Encircling Saturn’s South Pole
Why this signal matters

Why selected

長期の反復観測が、一枚の画像では捉えにくい惑星大気の形成過程を可視化した。

選定方針

AOI note

観測AIでも、単発の検出精度だけでなく、時系列の整合性と観測条件の変化を残すことが重要になる。

Published
Observed
Topic 研究
Context
OFFICIAL research.google BRIEF NEW

衛星画像の深層学習でメタン排出源を世界規模に地図化

Source fact

Google Researchは、NASA EMITのハイパースペクトルデータからメタン濃度、プルーム境界、発生源を推定するMAPL-EMITを公開した。360万の模擬プルームで学習し、専門家注釈で84%の再現率、約1,100グラニュールで約50%多い妥当なプルームを検出したと報告する。

Read the direct source Mapping global methane emissions from space with deep learning
Why this signal matters

Why selected

環境監視で、モデル、データ、推論ライブラリを同時公開し、検出から検証へ進める材料になる。

選定方針

AOI note

利用時は信頼度閾値別の見逃しと誤検出、地形別の偏り、現地確認コストを合わせて記録する。

RELEASE blog.google BRIEF NEW

Google、限定参加のサイバー防御制度Fairwind Programを開始

Source fact

Googleは、政府機関と信頼されたパートナー向けの限定アクセス制度Fairwind Programを発表した。Gemini 3.8 Flash CyberとCodeMenderを組み合わせ、脆弱性の発見、検証、修正を支援すると説明している。

Read the direct source Proactive cyber defense for governments and enterprises
Why this signal matters

Why selected

高度なサイバー防御モデルを単体提供ではなく、限定参加、認証、修正ハーネスを含む運用境界として設計した。

選定方針

AOI note

導入前に、対象リポジトリ、修正権限、検証環境、レビュー担当、ロールバック条件を分離し、自動修正の速度と誤修正リスクを同時に測る。

PAPER arxiv.org WATCH NEW

エージェントの実行経験からハーネスと方策を共同更新するSafeEvolve

Source fact

SafeEvolveは、完了したオンポリシー軌跡の安全証拠から、安全プロンプトと階層スキルを限定更新し、SFTとRLで方策側も共同改善する枠組みを提案する。Qwen3.5-4BでAgentDojoの攻撃成功率を3分の1にし、良性効用を59.79%から61.86%へ高めたと報告する。

Read the direct source SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment
Why this signal matters

Why selected

安全対策を固定ルールかモデル学習の二者択一にせず、監査可能な実行層と方策を分離して更新する研究例になる。

選定方針

AOI note

自動更新には、変更単位、ロールバック、評価データ汚染、攻撃成功率と良性効用の同時監視が必要。

前のEditionを読む