← The AI Crime Files

最新技術分析 · Harness Engineering

Meta Muse Sentinel:AIエージェントは別のAIを安全に監督できるのか

Meta Museは、個人エージェントと外部サービスの間に別のAIエージェントSentinelを置きます。Museが行動を提案し、Sentinelが許可、拒否、またはユーザー確認を行います。重要なHarness Engineeringの設計ですが、AIがAIを審査するだけでは不十分です。決定論的なポリシー、最小権限、保護されたログ、フェイルクローズの実行は両モデルの外側に必要です。

安全な仮想マシン内の青いAIと、メール、予定表、決済のツール呼び出しを検査する琥珀色のSentinelを描いた編集用イラスト
Original editorial illustration · September 9, 2026

Evidence classification: 確認済み:Metaは2026年9月8日にMuseを公開し、SentinelとSecure VMを説明。報道:Reutersが社内テストの問題を報告。未証明:すべてのプロンプトインジェクションや無許可行動を防げること。分析:実環境でのエージェント間監督。

01

Metaが公開したもの

Museは専用Secure VMで動作し、メール、予定表、買い物、決済を利用できます。コネクターはモデルの判断を現実の副作用へ変えます。

02

信頼境界を変えるSentinel

MetaによればSentinelは独立したエージェントで、コネクターとネットワーク送信の唯一の許可権限です。重要な確認はMuseを経由しません。

03

証拠が示す範囲

Reutersは社内テストでの機密データ露出、ガードレールの誤作動、信頼性問題を報じました。Metaは個別事案にコメントしていません。

04

Harness Engineeringへの示唆

モデルはシステムの一部にすぎません。harnessが観測、記憶、呼び出し、実行、永続化、復旧、エスカレーションを決めます。最終権限は決定論的ポリシーが持つべきです。

  • 狭く失効可能な権限。
  • 行動、相手、金額、内容に結び付く承認。
  • MuseからSentinelを分離。
  • 提案から副作用まで記録。
  • 不確実時は拒否。
  • インジェクションと再試行を検証。
05

今後の検証点

接続アプリ内の悪意ある内容、ポリシー変更、承認内容と実行内容の差を独立検証する必要があります。これは犯罪報告ではありません。

Sources

FAQ

Meta Muse Sentinelとは?

Metaによれば、コネクターとネットワーク送信を管理する独立エージェントです。

AIが別のAIを監督できますか?

文脈判断には役立ちますが、制約は決定論的なコードとポリシーが強制すべきです。

犯罪は起きましたか?

いいえ。本稿は犯罪として扱わず、予防的な技術分析として明示します。