最新技術分析 · Harness Engineering
Meta Muse Sentinel:AIエージェントは別のAIを安全に監督できるのか
Meta Museは、個人エージェントと外部サービスの間に別のAIエージェントSentinelを置きます。Museが行動を提案し、Sentinelが許可、拒否、またはユーザー確認を行います。重要なHarness Engineeringの設計ですが、AIがAIを審査するだけでは不十分です。決定論的なポリシー、最小権限、保護されたログ、フェイルクローズの実行は両モデルの外側に必要です。

Evidence classification: 確認済み:Metaは2026年9月8日にMuseを公開し、SentinelとSecure VMを説明。報道:Reutersが社内テストの問題を報告。未証明:すべてのプロンプトインジェクションや無許可行動を防げること。分析:実環境でのエージェント間監督。
Metaが公開したもの
Museは専用Secure VMで動作し、メール、予定表、買い物、決済を利用できます。コネクターはモデルの判断を現実の副作用へ変えます。
信頼境界を変えるSentinel
MetaによればSentinelは独立したエージェントで、コネクターとネットワーク送信の唯一の許可権限です。重要な確認はMuseを経由しません。
証拠が示す範囲
Reutersは社内テストでの機密データ露出、ガードレールの誤作動、信頼性問題を報じました。Metaは個別事案にコメントしていません。
Harness Engineeringへの示唆
モデルはシステムの一部にすぎません。harnessが観測、記憶、呼び出し、実行、永続化、復旧、エスカレーションを決めます。最終権限は決定論的ポリシーが持つべきです。
- 狭く失効可能な権限。
- 行動、相手、金額、内容に結び付く承認。
- MuseからSentinelを分離。
- 提案から副作用まで記録。
- 不確実時は拒否。
- インジェクションと再試行を検証。
今後の検証点
接続アプリ内の悪意ある内容、ポリシー変更、承認内容と実行内容の差を独立検証する必要があります。これは犯罪報告ではありません。
Sources
FAQ
Meta Muse Sentinelとは?
Metaによれば、コネクターとネットワーク送信を管理する独立エージェントです。
AIが別のAIを監督できますか?
文脈判断には役立ちますが、制約は決定論的なコードとポリシーが強制すべきです。
犯罪は起きましたか?
いいえ。本稿は犯罪として扱わず、予防的な技術分析として明示します。