使用独立 Research Core 把模型比较、软件评估或其他可证伪问题转化为可恢复、可复现、证据可追溯的研究。 用于用户要求研究、对照实验、基线比较、模型替代评估、消融、盲评、证据审计,或问题不能仅凭常识可靠下结论的场景。 不用于简单事实查询、无需实验的低风险判断,或用户只要求普通文案/解释的场景。
66
79%
Does it follow best practices?
Run evals on this skill
Adds up to 20 points to the overall score
View guide
Passed
No findings from the security scan
Fix and improve this skill with Tessl
tessl review fix ./skills/research-lab/SKILL.mdResearch Skill 是独立 Research Runtime 的使用协议,不是研究系统本体。它负责识别研究任务、约束研究设计、调用稳定 research_ 前缀工具,并依据 Evidence 返回结论;实验、统计、Workspace、同步和恢复由 Research Core 负责。
满足任一条件时使用:
不要用于简单事实查询、单一确定答案、无需实证的文案建议或低成本可逆选择。
baseline、candidates、dataset/cases、metrics、decision rules 和 adapters;执行字段以当前 research validate 为准。UNSUPPORTED,不得模拟实验结果。INVALID;有效实验但证据不足时返回 INCONCLUSIVE。research_validate;否则生成便携 JSON 文件后调用 research_create。research_inspect 检查 revision、数据集、Adapter 和决策阈值。缺关键条件时停止执行并返回结构化缺口。research_execute。已有 run 时传入 run id;中断后调用 research_continue,不要创建重复研究冒充恢复。research_status 查看已完成/失败/待执行项,不进行热轮询;等待真实执行反馈。research_compare,再用 research_evidence 获取支撑与限制。SUPPORTED、REJECTED、INCONCLUSIVE、UNSUPPORTED、INVALID。{
"protocolVersion": "1.0",
"researchId": "model-replacement-evaluation",
"question": "Candidate 是否可替代 Baseline 完成指定任务?",
"taskType": "llm-comparison",
"hypotheses": [{"id": "h1", "statement": "candidate 质量不低于 baseline 且成本更低"}],
"baseline": {"id": "baseline", "adapter": "command"},
"candidates": [{"id": "candidate", "adapter": "command"}],
"dataset": {
"cases": [{"id": "case-1", "input": "...", "expected": "..."}]
},
"metrics": ["exact_match", "latency_ms", "cost"],
"decisionRules": {
"minDelta": 0.0,
"preferred": "candidate"
},
"adapters": {
"command": {
"type": "command",
"command": ["python", "path/to/adapter.py"]
}
}
}字段以安装版本的 research validate 为准;不要凭 Skill 正文猜测 Core 已新增的字段。
最终报告包含:
Research ID / revision
Question 与 Hypothesis
Baseline、Candidate、数据集与指标
Run 状态和环境/Adapter 版本
Decision
关键 Evidence(含 artifact digest)
限制、冲突与尚缺证据
复现或继续命令不得把 ok: true、工具成功或单次模型输出当作研究结论。相关示例见 examples/llm-replacement.md。
3677cfc
If you maintain this skill, you can claim it as your own. Once claimed, you can manage eval scenarios, bundle related skills, attach documentation or rules, and ensure cross-agent compatibility.