CtrlK
BlogDocsLog inGet started
Tessl Logo

agent-harness-audit

Audita un arnes agentico existente con score determinista de 35 checks: presencia, calidad (staleness por contenido, placeholders, evidencia vacia, ciclos de dependencias), comandos stack-verified, monorepo y capa de enforcement (hooks registrados que leen stdin, Stop con max_turns, alcance estructurado, ruta unica de escritura), con anti-gaming por lineas estructuradas. Usar al pedir 'auditar arnes', 'harness audit', 'score del arnes', 'por que mi agente dice done y falla'. NO para auditar skills del toolkit (usar toolkit-hardener) ni auditorias de accesibilidad.

65

Quality

82%

Does it follow best practices?

Run evals on this skill

Adds up to 20 points to the overall score

View guide

SecuritybySnyk

Passed

No findings from the security scan

SKILL.md
Quality
Evals
Security

Agent Harness Audit

Que es

Mide la calidad real de un arnes, no su presencia: 35 checks deterministas via ${CLAUDE_PLUGIN_ROOT}/skills/agent-harness-creator/scripts/audit_harness.py (references/checks-de-calidad.md). Un feature_list con 5 placeholders intactos NO puntua igual que uno real: staleness derivada de contenido cruzado (progress vs features vs evidencia en disco), ciclos de dependencias (Kahn), done-sin-evidencia, y prosa con keywords vale cero — solo puntuan lineas estructuradas (references/anti-gaming.md). [CÓDIGO]

Cuando usar

  • "El agente dice done pero los tests fallan", "puntua mi arnes", "que le falta a mi AGENTS.md".
  • NO para auditar packets de skills de este plugin: eso es toolkit-hardener.

Procedimiento

  1. Corre ${CLAUDE_PLUGIN_ROOT}/skills/agent-harness-creator/scripts/audit_harness.py <dir> --json. [CÓDIGO]
  2. Reporta score /100, checks fallidos con detalle textual y grupo (presencia/calidad/stack/monorepo/hooks/write-path). Para exigir que la capa de enforcement sobreviva independientemente del score: --require H1-hooks-registered,H2-hooks-read-stdin,H3-stop-bound-enforced,W1-single-write-path. [CÓDIGO]
  3. Si hay fallos mecanicos, encadena a agent-harness-repair con la salida de --emit-fix.
  4. Si el drift es docs-vs-realidad, encadena a agent-harness-diagnose.

Contract

  • Aceptacion: reporte con score, cada fallo con evidencia textual, y exit code coherente con el umbral (default 70). [CÓDIGO]
  • Limites: el score estructural no reemplaza una corrida real del agente sobre tareas semilla; eso queda declarado como gap. [EXPLICIT]
  • Casos borde: arnes sin package.json/Makefile (checks S se degradan a no-verificable, no a fallo); monorepo sin packages declarados (checks M no aplican); arnes v1 sin capa de enforcement (checks H/W skipped, no verdes: migrar con scaffold_harness.py). [EXPLICIT]
  • Supuestos: el arnes sigue la convencion de 5 archivos del creator. [SUPUESTO]
  • Trade-off: 35 checks son mas ruido inicial que 5; el detalle textual por check compensa con accion concreta. [EXPLICIT]

Packet

Capas del packet, cargables bajo demanda (disciplina ICM: una capa por vez, nunca todas juntas): references/ guías de profundidad (cargar UNA por etapa) · knowledge/ cuerpo de conocimiento · prompts/ prompts listos · examples/ salida de ejemplo · agents/ subagentes del packet · scripts/ automatización local · assets/ recursos estáticos.

Repository
JaviMontano/claude-plugins
Last updated
First committed

Is this your skill?

If you maintain this skill, you can claim it as your own. Once claimed, you can manage eval scenarios, bundle related skills, attach documentation or rules, and ensure cross-agent compatibility.