Guida pratica · Harness Engineering
Checklist di sicurezza per agenti IA: 10 controlli di Harness Engineering
Prima di concedere shell, repository, cloud o deploy, testa il sistema attorno al modello. Uno studio su 3.171 repository ha confermato difetti nel 16,0% delle configurazioni assemblate.

Evidence classification: CONFERMATO: lo studio misura configurazioni, non compromissioni runtime. NON CONFERMATO: esfiltrazione o sfruttamento di ogni repository. ANALISI: i controlli estendono i risultati a un modello produttivo.
What the study measured
Su 2.660 setup, 9,8% usava MCP non versionato, 3,1% concedeva esecuzione arbitraria dietro permessi apparentemente limitati e 3,8% conteneva skill che preapprovavano la shell. Unione: 16,0%. Nessuna esfiltrazione confermata.
The 10 production checks
- 01
Fissa le dipendenze MCP
Test: Rifiuta launcher senza versione, digest o lockfile.
Evidence: The study confirmed unpinned MCP packages in 9.8% of 2,660 assembled setups.
- 02
Espandi i pattern di permesso
Test: Verifica cosa può eseguire davvero ogni pattern.
Evidence: 3.1% of setups carried an arbitrary-execution grant disguised as a narrower permission.
- 03
Tratta le skill come eseguibili
Test: Controlla istruzioni, script, origine e commit.
Evidence: 3.8% of setups and 3.7% of skill collections contained a skill that pre-approved shell access.
- 04
Separa intenzione e autorità
Test: Il modello propone; la policy deterministica autorizza.
Evidence: A prompt is advisory. The harness and tool layer decide what can actually execute.
- 05
Isola il raggio d’impatto
Test: Usa sandbox, credenziali effimere e allowlist.
Evidence: Installed harness components run with developer privileges unless the execution environment narrows them.
- 06
Lega l’approvazione all’effetto
Test: Lega il consenso a comando e payload esatti.
Evidence: Broad approvals convert a one-time human decision into reusable authority.
- 07
Isola memoria e segreti
Test: Non ereditare segreti o memoria senza necessità.
Evidence: Composition creates paths that no individual configuration file reveals.
- 08
Registra decisione e risultato
Test: Conserva policy, consenso, risposta e diff.
Evidence: Auditing configuration alone cannot prove what the runtime later executed.
- 09
Rendi i retry idempotenti
Test: Usa chiavi, checkpoint e rollback testato.
Evidence: Recovery can repeat an already completed side effect when state is ambiguous.
- 10
Valida il harness in CI
Test: Analizza insieme contesto, skill, hook, MCP e subagenti.
Evidence: 16.0% of studied setups had at least one confirmed security defect; raw scanner output overestimated risk, so findings need validation.
Threat path: from installation to side effect
A secure harness places independent checks between every step. Reviewing the model alone cannot detect a package that changes later, a skill that carries shell permission, or an approval that authorizes more than the user saw.
Primary evidence and reproducibility
FAQ
Cos’è questa checklist?
Dieci gate verificabili attorno all’agente.
Perché fissare MCP?
Impedisce download diversi nelle esecuzioni future.
Le skill sono documentazione?
No; possono produrre esecuzione reale.
Garantisce sicurezza?
No; servono anche red team e monitoraggio.