CtrlK
BlogDocsLog inGet started
Tessl Logo

skill-quality-gate

评估 Codex Skill 的触发边界、内部流程、输出契约、验证方式和回归质量。用于审查或优化现有 Skill、发布前做行为质量检查、比较修改前后的 Skill 质量,默认只读,不替代仓库结构校验或跨设备同步。

68

Quality

83%

Does it follow best practices?

Run evals on this skill

Adds up to 20 points to the overall score

View guide

SecuritybySnyk

Passed

No findings from the security scan

SKILL.md
Quality
Evals
Security

Skill 质量门禁

适用范围

使用本 Skill 审查一个 Skill 包或一个 Skill 仓库的行为质量,重点关注:

  • 触发条件是否足够具体,是否明确不适用场景。
  • 工作流程是否有顺序、边界和可执行的判断。
  • 输出契约是否能让用户和测试复核结果。
  • 安全边界、事实/假设区分和副作用控制是否完整。
  • 示例、脚本和回归测试是否真正覆盖 Skill 的关键行为。

默认只读。用户明确要求修改时,先输出问题清单和最小改动面,再实施修改。

不适用场景

  • 只检查 skills.json、目录、链接或元数据完整性:使用 skill-repository-maintainer
  • 只需要执行一个已知 Skill,而不是评估 Skill 本身。
  • 没有目标 Skill、示例或可观察输出,无法进行行为评估时;应报告证据不足,不得凭感觉打分。

审查流程

  1. 确认目标路径、版本、语言、依赖和本次审查范围。
  2. 读取 SKILL.mdagents/openai.yaml、示例、引用资料和脚本;不把运行时文件当作 Skill 内容。
  3. 评估触发、边界、流程、输出、验证和安全六个维度,分别记录事实、推断和缺失证据。
  4. 优先运行包内已有的 smoke test、示例检查或质量脚本;失败时保留原始错误。
  5. 按影响和修复成本排序,给出最小修复建议;不为了对称性重写整个包。

输出契约

输出以下内容:

  1. PASSPARTIALBLOCKED
  2. 目标 Skill 和版本。
  3. 通过项、失败项和证据路径。
  4. 触发边界、流程、输出、验证、安全六维结论。
  5. 按 P0/P1/P2 排序的改进项。
  6. 未验证的行为、残余风险和明确不应修改的范围。

不要把“结构校验通过”写成“行为质量通过”,也不要把旧输出或旧哈希当作本次修改的证据。

验证

对仓库内的 Skill 包运行:

python3 skill-quality-gate/scripts/quality_report.py --root . --strict

脚本只使用 Python 标准库,检查 frontmatter、长度、边界/输出/验证章节、UI 元数据和非空示例。复杂 Skill 仍需运行自己的回归测试;结构脚本不能替代真实任务前测。

详细评分维度见 质量评分表

Repository
ooooooooooooooooooop/agent-tools
Last updated
First committed

Is this your skill?

If you maintain this skill, you can claim it as your own. Once claimed, you can manage eval scenarios, bundle related skills, attach documentation or rules, and ensure cross-agent compatibility.