EDITION
ROLLING EDITION
AOIFUTURE News — 最終スコアの先で、AIの動きと権限を測り直す
長期研究エージェントとHumanTrackerを深掘り。OAuth、AI就業訓練、オープンモデル、空間推論を短報で追う。
SOURCE-FIRST SIGNALS
Signals
長期研究エージェントは「自律研究者」より、まだ工学的な最適化役に近い
Source fact
著者らは7つのフロンティアモデルを36件の長期タスクで評価し、現行エージェントは実用解を組み立てられる一方、試行間のばらつきが大きく、真に新しい方法の創出はまれだと報告した。
Why this signal matters
Why selected
最終スコアだけでは見えない、問題設定・実行・フィードバック制御・経験再利用の差を評価対象にした。
選定方針AOI note
長期タスクでは成果物だけでなく、途中の判断、再試行、経験の再利用が本当に改善へ寄与したかを記録する。
人型ロボットの動きは、姿勢誤差だけではなく「人が違和感を持つ失敗」で測る
Source fact
著者らは約153時間の光学式モーション軌跡を含むHumanTrackerと、12,000組・24,000モーションの選好データで学習したHumanScoreを提示した。
Why this signal matters
Why selected
足滑りや接地タイミングなど、平均的な姿勢誤差では落ちやすい身体的な破綻を人の知覚に寄せて評価する。
選定方針AOI note
生成映像やロボット動作でも、数値誤差と人が感じる自然さを別々に測る設計が必要になる。
GitHub OAuth、短命トークンと複数リダイレクトURIを追加
Source fact
GitHubはOAuthアプリ向けに8時間のアクセストークンと6か月のリフレッシュトークン、最大10件のリダイレクトURI、任意のワイルドカード照合を追加し、新規アプリでは短命トークンを既定にした。
Why this signal matters
Why selected
エージェント連携の認証を、長寿命トークン前提からローテーション可能な設計へ移す具体的な更新。
選定方針AOI note
ワイルドカードは便利さより乗っ取り面が増えるため、不要なら無効化し、callback先の所有境界を点検する。
英国北西部、16〜21歳向けAI就業ブートキャンプを試行
Source fact
英国政府は最大70人の16〜21歳を対象に、3週間のAI・職場スキル訓練と、その後の地域企業・公共部門の実習機会を組み合わせる試行を開始した。
Why this signal matters
Why selected
AI教育を座学で終わらせず、責任ある利用、人の監督、品質管理、就業経路まで一体で試す公共施策。
選定方針AOI note
参加者数だけでなく、修了、実習移行、雇用継続、地域差を追って初めて政策効果を判断できる。
オープンモデルは増えたが、ダウンロードはごく一部へ集中
Source fact
Hugging Faceは2026年1〜8月に公開モデルリポジトリが243万から296万へ増えた一方、85.6%は生涯ダウンロード200未満で、1.5%のリポジトリが全ダウンロードの99.2%を占めたと報告した。
Why this signal matters
Why selected
公開件数の増加と実利用の集中を分けて見せ、open weightの活況を採用実態へ読み替える材料になる。
選定方針AOI note
モデル選定では話題性や公開数ではなく、更新継続、実行環境、利用実績、ライセンスを並べて確認する。
VLMは静止画の空間認識より、変化を伴う計画でトポロジーを失いやすい
Source fact
Microsoft Researchは連結、分離、順序、包囲、結び目を推論・計画の両方で測るMindTopoを紹介し、現行VLMは静的認識より対話的な操作計画で構造関係を維持しにくいと報告した。
Why this signal matters
Why selected
ロボットや操作エージェントで、見えている状態を答える力と、変化後も制約を守る力を分離して評価できる。
選定方針AOI note
視覚エージェントのゲートには単発QAだけでなく、状態遷移後の接続・内外・順序を保つテストを入れる。