Our review
Runs a supervised dry-run of a prose skill in a disposable sandbox to validate its output without affecting real areas.
Strengths
- Validates generative skills safely without production impact
- Uses structural invariants and golden snapshots for robust testing
- Catches regressions automatically when refactoring or modifying skills
Limitations
- Not suitable for conversational skills with non-deterministic output
- Requires a pre-built test kit (golden_inputs, verify.sh) to be effective
- Can be overhead-heavy for very complex skills
Before modifying or refactoring any skill that produces verifiable artifacts (files, scaffolds, configs).
For purely advisory or conversational skills where responses are unpredictable or cannot be snapshot-tested.
Security analysis
SafeThe skill describes a sandboxed dry-run procedure that explicitly avoids side effects, real-world changes, and destructive actions. No risky commands or data exfiltration are instructed.
No concerns found
Examples
/dry-run-skill projectRun a dry-run on the refactored version of /discovery skill against its golden inputs.Perform a dry-run of the /scaffold skill using its test kit in /tmp/dryrun-scaffold-1./dry-run-skill — Valida uno skill in prosa senza eseguirlo in produzione
Quando ricevi questo comando (con il nome di uno skill, es. /dry-run-skill project), esegui un dry-run
sorvegliato di quello skill: lo lanci in una sandbox usa-e-getta con input fissi, ne verifichi gli INVARIANTI
dell'output, e riferisci PASS/FAIL — senza toccare aree reali.
Perché esiste: gli skill in prosa (
/project,/discovery, generatori di scaffold/file) li esegue l'LLM — non hanno un test runtime nativo. Rifattorizzarli o modificarli "al buio" rompe in silenzio. Questa è la rete. Dettaglio e fondamento: SSOTDRYRUN_PROTOCOLeKNOW_HOW_TRANSFER_PROTOCOL(paradigma).
Quando usarlo
- PRIMA di modificare/rifattorizzare uno skill che genera artefatti verificabili (file, scaffold, descrittori, config).
- Per validare uno split/refactor (es.
/projectmonolitico → micro-skill): si confronta il nuovo output col golden. - Come test di accettazione di uno skill nuovo generatore.
- NON serve per skill conversazionali/consulenziali (niente output deterministico da snapshottare).
Il "kit" di dry-run di uno skill (convenzione)
Ogni skill validabile ha un kit con tre pezzi (è la convenzione da seguire/creare se manca):
golden_inputs.json— risposte canoniche FISSE, scelte deterministiche e senza side-effect (per/project: paradigma-solo, niente librerie, RAG offline).verify.sh <dir>(overify_scaffold.sh) — verifier degli INVARIANTI strutturali (NON byte-diff): placeholder risolti, campi-chiave corretti, schema atteso, ecc. Deve essere una rete vera (bocciare un albero rotto).golden/<...>— snapshot dell'output dello skill ATTUALE con quegli input (riferimento d'oro).
Kit di riferimento esistente per /project: os3-matrix/docs/tests/m-os3-065/.
Procedura (eseguila così)
- Localizza il kit dello skill richiesto (
golden_inputs.json+verify*.sh+golden/). Se manca, dillo e proponi di crearlo (non inventare input). - Sandbox: crea una dir usa-e-getta
/tmp/dryrun-<skill>-<n>. Lavora SOLO lì. - Esecuzione sorvegliata: spawna un agente (o esegui tu) con istruzione di ESEGUIRE lo skill target (leggi il
suo
.md) contro la sandbox usando SOLOgolden_inputs, in modalità non-interattiva (non chiedere nulla) e senza side-effect (NON clonare, NON installare, NON toccare aree reali). - Verifica: lancia
verify*.sh <albero-prodotto>→ exit 0 atteso. Se è un refactor, confronta anche i file chiave colgolden/(match semantico, non byte). - Riferisci: PASS (zero violazioni) o FAIL con l'elenco esatto degli scostamenti.
- Teardown: rimuovi la sandbox.
Esito
- PASS = lo skill (o la sua versione rifattorizzata) produce un output conforme agli invarianti e allineato al golden.
- FAIL = scostamenti da spiegare e correggere PRIMA di attivare/spedire la modifica. Mai attivare al buio.
Vedi anche: agente
skill-dryrun-guardian(si auto-attiva quando stai per toccare uno skill in prosa e ti ricorda di usare questa rete),KNOW_HOW_TRANSFER_PROTOCOL(perché questa capacità è nel prodotto, non in memoria privata).
TDD Red-Green-Refactor
Testing
Skill that guides Claude through the complete TDD cycle.
Web Accessibility Audit
Testing
Performs a comprehensive web accessibility audit following WCAG standards.
UAT Test Case Generator
Testing
Generates structured and comprehensive user acceptance test cases.