Harness Engineering book ←

Guida pratica · Harness Engineering

Checklist di sicurezza per agenti IA: 10 controlli di Harness Engineering

Prima di concedere shell, repository, cloud o deploy, testa il sistema attorno al modello. Uno studio su 3.171 repository ha confermato difetti nel 16,0% delle configurazioni assemblate.

Illustrazione editoriale di un agente autonomo circondato da dieci controlli che bloccano rischi supply-chain
Original editorial illustration · September 10, 2026

Evidence classification: CONFERMATO: lo studio misura configurazioni, non compromissioni runtime. NON CONFERMATO: esfiltrazione o sfruttamento di ogni repository. ANALISI: i controlli estendono i risultati a un modello produttivo.

What the study measured

Su 2.660 setup, 9,8% usava MCP non versionato, 3,1% concedeva esecuzione arbitraria dietro permessi apparentemente limitati e 3,8% conteneva skill che preapprovavano la shell. Unione: 16,0%. Nessuna esfiltrazione confermata.

3,171repositories
16.0%security defect
9.8%unpinned MCP
3.8%skill pre-approved shell

The 10 production checks

  1. 01

    Fissa le dipendenze MCP

    Test: Rifiuta launcher senza versione, digest o lockfile.

    Evidence: The study confirmed unpinned MCP packages in 9.8% of 2,660 assembled setups.

  2. 02

    Espandi i pattern di permesso

    Test: Verifica cosa può eseguire davvero ogni pattern.

    Evidence: 3.1% of setups carried an arbitrary-execution grant disguised as a narrower permission.

  3. 03

    Tratta le skill come eseguibili

    Test: Controlla istruzioni, script, origine e commit.

    Evidence: 3.8% of setups and 3.7% of skill collections contained a skill that pre-approved shell access.

  4. 04

    Separa intenzione e autorità

    Test: Il modello propone; la policy deterministica autorizza.

    Evidence: A prompt is advisory. The harness and tool layer decide what can actually execute.

  5. 05

    Isola il raggio d’impatto

    Test: Usa sandbox, credenziali effimere e allowlist.

    Evidence: Installed harness components run with developer privileges unless the execution environment narrows them.

  6. 06

    Lega l’approvazione all’effetto

    Test: Lega il consenso a comando e payload esatti.

    Evidence: Broad approvals convert a one-time human decision into reusable authority.

  7. 07

    Isola memoria e segreti

    Test: Non ereditare segreti o memoria senza necessità.

    Evidence: Composition creates paths that no individual configuration file reveals.

  8. 08

    Registra decisione e risultato

    Test: Conserva policy, consenso, risposta e diff.

    Evidence: Auditing configuration alone cannot prove what the runtime later executed.

  9. 09

    Rendi i retry idempotenti

    Test: Usa chiavi, checkpoint e rollback testato.

    Evidence: Recovery can repeat an already completed side effect when state is ambiguous.

  10. 10

    Valida il harness in CI

    Test: Analizza insieme contesto, skill, hook, MCP e subagenti.

    Evidence: 16.0% of studied setups had at least one confirmed security defect; raw scanner output overestimated risk, so findings need validation.

Threat path: from installation to side effect

Marketplace artifact
Harness configuration
Agent context
Tool authority
External side effect

A secure harness places independent checks between every step. Reviewing the model alone cannot detect a package that changes later, a skill that carries shell permission, or an approval that authorizes more than the user saw.

Primary evidence and reproducibility

FAQ

Cos’è questa checklist?

Dieci gate verificabili attorno all’agente.

Perché fissare MCP?

Impedisce download diversi nelle esecuzioni future.

Le skill sono documentazione?

No; possono produrre esecuzione reale.

Garantisce sicurezza?

No; servono anche red team e monitoraggio.