在 DSH 长程任务中为决策层加装五道防偏闸门:原始证据锚、对抗式对齐审计、跨包一致性校验、成本比对、防御自检,防止目标漂移、验收失真与摘要偏差。用于跨会话长任务、多 worker 并行、审计类任务、成本敏感任务的 checkpoint 记录与恢复,以及任何需要"决策层不跑偏"保障的执行场景。
66
80%
Does it follow best practices?
Run evals on this skill
Adds up to 20 points to the overall score
View guide
Low
Low-risk findings worth noting
决策层跑偏的根因不是提示词不够强,而是状态没有物化:目标只存在于对话里、验收只依赖自述、恢复只信任摘要。决策闸门把防偏从"意志"变成"硬门禁":
gate_scope_lock.py 严格校验变更文件集,任何触碰 Non-Goals 或越界文件直接判 SCOPE_VIOLATION,0 token。gate_deadband.py 自动触发 DEADBAND_TRIPPED,强制推翻假设并回退,0 token。零 token 原则:闸门 2/3/4/5/6 是纯数据算法逻辑,必须用 scripts/ 下的 Python 脚本执行,禁止用 LLM 调用替代;这些机械 scope/cost/integrity 检查保持低成本执行,不因事件化而删除。唯一消耗 token 的闸门 1 用最便宜档位的独立 subagent,按上方事件驱动触发。
验证预算(VERIFICATION_PURPOSE):任何验证/审计动作执行前必须能回答:
hypothesis: 要验证什么假设
uncertainty_removed: 通过后消除了什么不确定性
pass_action: 验证通过后的下一动作
fail_action: 验证失败后的下一动作若 pass_action == fail_action 且没有新的风险证据,通常跳过该验证。验证必须产出 Progress Delta(改变 next action 或 done state),否则视为无进展动作(见 execution-discipline「Progress Delta」)。
触发(满足任一即启用本技能):
不适用:
create_goal 锁定原始 objective,逐字拷贝保存。checkpoints/ 目录(或沿用 .agent-broker/topics/<topic>/checkpoints/)。templates/raw_evidence_anchors.json 复制锚模板到 checkpoints/raw_evidence_anchors.json 并填写 objective。templates/raw_evidence_anchors.json 结构记录本阶段的:
触发事件(满足任一即启动):objective 变更 / 关键假设被证伪 / 不可逆或高风险边界 / 多 worker 结果集成 / 证据相互冲突 / 连续无 Progress Delta / 重大架构决策 / 最终验收(必跑)。连续 ≥5 个 checkpoint 无事件时补一次低成本自检兜底。
templates/adversarial-audit-brief.md 生成派工单。run_in_background: true),只传 objective + 原始证据锚路径 + 产出物列表;禁止传任何摘要或 work_memory。job_output(job_id, wait=true, timeout_ms=60000) 长轮询收取。authorized_tier、authorized_model、budget_tokens。checkpoints/ 下全部锚。checkpoints/ 下每个阶段一个锚 JSON(cp-001.json、cp-002.json…)+ 一个工作摘要文件(summary.md,可选)。templates/raw_evidence_anchors.json 的字段:checkpoint_id、objective、evidence[](type/cmd/exit_code/last_lines | path/sha256 | skipped)、alignment_decision、decider_notes、gates_run[](gate 名 + 结果)。python scripts/run_tests.py(标准库,无第三方依赖),覆盖闸门 2/3/4/5/6 脚本的 PASS/FAIL 分支。python -c "import json; json.load(open('templates/raw_evidence_anchors.json', encoding='utf-8'))"。skills.json 发布。3677cfc
If you maintain this skill, you can claim it as your own. Once claimed, you can manage eval scenarios, bundle related skills, attach documentation or rules, and ensure cross-agent compatibility.