在重要任务上运行完整世界模型闭环的执行协议——恢复持久状态→建立竞争模型→显式预测→真实观察→修订模型→主动取证→决策→持久化。由 AGENTS.md World Model Gate 判 OFF/CORE/FULL 后加载;用于多步、高风险、跨会话、存在竞争解释或需要持久世界模型的真实任务,不用于简单一次性任务。
71
86%
Does it follow best practices?
Run evals on this skill
Adds up to 20 points to the overall score
View guide
Passed
No findings from the security scan
你正在执行一个带持久世界模型的任务。世界模型不是记忆库,是「当前对世界如何运作的最佳压缩 + 主动被测试的对象」。本协议定义九环如何真实执行,不是形式主义清单。
由 AGENTS Gate 判定,写入本会话 working state:
FULL 中每一环标 USED / NOT_NEEDED(reason) / UNKNOWN,允许空环但不允许跳过评估。
Canonical SSOT: ~/personal-ai-state/world-model/
current.yaml 当前最佳压缩模型。每条模型条目字段:
命题 / 状态(当前最佳|竞争) / 定性置信 / 支持证据ref /
反例 / 竞争解释 / 适用范围(Model Coverage) /
模型依赖(本结论依赖哪些上游模型) / 未知 / 异常 /
区分性观察(若H1为真应见…若H2为真应见…) /
更新历史(旧模型→新模型及原因) / 来源
另含 Open Predictions / Known Residuals / Open Loops /
watermark / evidence refs
operators.yaml 失效模式→算子表(provisional/validated/superseded)
open-loops.yaml 未闭合观察口
history/ 重大修订快照
Runtime: ~/.dsh/world-model/
current.json materialized 工作状态
ledger/YYYY-MM-DD.jsonl append-only 事件流
runs/<session-id>.jsonl 单会话轨迹
manifest.json 版本与指针
Episode schema(L1 情境记忆,ledger/runs 事件):
event_id / schema_version / session_id / task_id / event_type /
timestamp / actor / subject / scope / happened(一句话,细节引用L0) /
payload / evidence_refs /
因果关联: prediction_id / action_id / model_id / supersedes /
source(provenance) / evaluation_awareness
不要求每种事件全填,但 ID、类型、引用、因果关联必须存在——
要能机械回答「这个观察评价的是哪个预测」「这次更新替代哪个旧模型」。
Prediction schema(门禁绑定用,缺一不可):
prediction_id / subject / intended_action(绑定哪类动作) /
expected_observation / falsifier(什么结果算错) / time_horizon /
confidence_bucket / evidence_refs / created_at_event_id
禁止万能预测——不绑定具体动作范围的预测不能解锁 mutation。
工具风险分级(机械分级,模型不自报):
read / reversible-low / consequential / high-risk / irreversible
CORE 模式只拦 consequential 及以上:无绑定预测→guard 拒绝放行。
临时文件/格式化等 reversible-low 不设门禁。WM_ACTIVATE 声明进入 CORE/FULL 及理由
STATE_RESTORE 读 canonical current.yaml + watermark 后的 ledger → 构造 working state
CURRENT_MODEL 写出当前模型与 Model Coverage(哪些算数、哪些不算)
PREDICTION_CREATED 每条预测:可证伪、绑定将做的 Action、标置信(定性,不伪精确)
ACTION / QUERY 真实工具调用/检查/改动
OBSERVATION_RECORDED 只记录真实回读证据,引用 evidence ref(session id / 文件 / 测试)
PREDICTION_EVALUATED 逐条对照:confirmed / refuted / partial
UPDATE_APPLIED 或 NO_UPDATE 引用具体 Prediction+Observation;失败预测 → residual 标签 +
参数修订/结构修订/H4(换问题表征) 三选一明确记录
STATE_PERSISTED append ledger + 更新 runtime current.json;
达到重大变化门槛才写 canonical(见下)PROPOSED→provenance→reason→authorization→accepted,Outcome 不得直接覆写长期价值。runtime ledger 随时可写;canonical 只允许 proposal→治理路径写入,runtime 不得自动改写:失效模式新增/算子升降级、Current Model 实质修订、Open Loop 开关、跨会话需要继承的持久结论,均先落 proposals/ 待审。普通任务流水不进 canonical。
Learning Progress(可记录,禁止当 reward 优化): 按域跟踪 prediction coverage / resolved / exact-partial-failed / confidence_bucket / difficulty-novelty(可UNKNOWN) / natural-or-test / abstention / specificity。learnable/noise 标记只 provisional, 不因单次失败定案。只预测容易的事是 Goodhart 自证。
结束前确保:ledger 已 append、current.json 已更新、开放口已登记;下一次新会话 STATE_RESTORE 应能拿到本次全部持久结论——否则本协议未真实运行。
84f8ee2
If you maintain this skill, you can claim it as your own. Once claimed, you can manage eval scenarios, bundle related skills, attach documentation or rules, and ensure cross-agent compatibility.