Skill-Creator 详解:用 AI 创建 AI 技能的"元技能"
前面介绍了 Skills.sh(技能商店)和 find-skills(技能搜索引擎)——一个是"买技能的地方",一个是"搜技能的工具"。但如果你想自己创造一个技能并发布到 Skills.sh 呢?手写 SKILL.md + 设计测试用例 + 优化触发描述 + 验证效果……门槛不低。skill-creator(Anthropic 官方出品,32 万+ 安装)就是来解决这个问题的——它本身也是一个 Skill,但它的职责是"帮你创建、测试和迭代其他技能"。用它,你可以用 AI 来创建 AI 技能——从意图到草稿、从测试到评估、从迭代到发布,全流程引导。
技能页面:skill-creator(Skills.sh);安装:npx skills add anthropics/skill-creator。
1、Skill-Creator 是什么
skill-creator 是 Anthropic 官方发布的"元技能"(meta-skill)——它的功能不是教 AI 某个具体领域的知识,而是引导你(和 AI 一起)创建一个新的技能。从"我想做一个 XX 技能"的想法开始,到"一个经过测试、有数据支撑、可发布的成品技能"结束,全程结构化引导。
// 核心定位
skill-creator = 用 AI 创建 AI 技能的"元技能"
// 三大技能的生态闭环
Skills.sh → 商店(买技能的地方)
find-skills → 搜索引擎(找技能的工具)
skill-creator → 创建器(做技能的工具)
→ 三者构成"发现→获取→创造"的完整生态
// 基本面
// 作者:Anthropic(官方)
// 安装:32 万+
// 安全审计:通过 Socket / Snyk / Gen Agent Trust Hub 三重审查
// 核心能力:创建 + 测试 + 评估 + 迭代 + 优化2、核心工作流:七步创建一个技能
// skill-creator 的创建流程(七步循环)
Step 1: 意图捕获(Intent Capture)
"你想做一个什么技能?它应该做什么?大致怎么工作?"
→ AI 引导你把模糊的想法变成清晰的目标
Step 2: 草拟(Drafting)
AI 根据意图,帮你写出技能的第一版 SKILL.md
→ 包含:技能描述、触发条件、工作步骤
Step 3: 测试用例创建(Test Case Creation)
AI 帮你设计测试场景——"装了技能后 AI 应该怎么做"
→ 生成测试提示词(test prompts)
Step 4: A/B 对比测试(Parallel Testing)
对每个测试用例,同时跑两个版本:
A:没有技能的 AI(baseline 基线)
B:装了技能的 AI(with skill)
→ 对比两个输出的差异,量化技能的真实效果
→ 同时记录 token 用量和延迟(效率指标)
Step 5: 评估(Evaluation)
如果没有现成的量化评估标准,AI 帮你起草一个
→ 指标:通过率 / 延迟 / token 效率
→ 生成浏览器版可视化评审面板(interactive review dashboard)
Step 6: 迭代(Iteration)
根据测试结果和反馈,重写技能
→ 修复"技能没起作用"的场景
→ 优化"技能起作用但效果不好"的场景
→ 然后重新跑 Step 3-5,循环改进
Step 7: 扩展验证(Scale)
满意后,扩大测试集规模,做更大范围的验证
→ 确认技能在各种场景下都稳定有效- 灵活入口:不需要从 Step 1 开始——如果你已有草稿,直接跳到 Step 4 测试评估
3、关键特性:A/B 测试与量化评估
// skill-creator 最大的技术亮点:A/B 对比测试
传统做法:
写一个技能 → 自己看看输出对不对 → 改改 → 发布
→ 没有数据支撑,"感觉好"不等于"真的好"
skill-creator 的做法:
对每个测试用例,并行跑 "有技能 vs 无技能"
→ 量化技能带来的真实提升
→ 指标包括:
通过率(Pass Rate) 有技能时测试通过的比例
延迟(Latency) 有技能 vs 无技能的响应时间
Token 效率 有技能 vs 无技能的 token 消耗
→ 证明"这个技能确实有用,且数据可量化"4、描述优化:让技能"该触发时触发、不该触发时不触发"
技能的"描述"(description)决定了 AI 何时调用它:描述太宽泛 → 不该触发时也触发(误触发);描述太狭窄 → 该触发时不触发(漏触发)。
skill-creator 的描述优化流程:
1. 生成 20 个"真实场景"查询(10 个应该触发 + 10 个不应该)
2. 用这些查询测试技能的触发准确率
3. 最多迭代 5 轮,优化描述文本
4. 目标:该触发时触发、不该触发时不触发
- 结果:技能的"触发精度"经过量化优化——不是"写完描述就发布",而是"测试+迭代到满意才发布"
5、交互式评审面板
skill-creator 通过 eval-viewer/generate_review.py 生成一个浏览器端的评审面板,让你直观看到"技能到底带来了什么改变"——不需要读 JSON/日志,浏览器打开就能看。
- 每个测试用例的"有技能 vs 无技能"输出对比
- 定性反馈(输出好不好、为什么)
- 定量指标(通过率、延迟、token 效率)
- 多轮迭代的对比(v1 vs v2 vs v3...)
6、安装与使用
// 安装
npx skills add anthropics/skill-creator
// 或
npx skills add https://github.com/anthropics/skills --skill skill-creator
// 安装后,在 Claude Code / Cursor 里直接对话
// 示例 1:从头创建一个技能
> 我想创建一个"代码审查"技能,教 AI 按团队规范审查代码
// → skill-creator 引导你:
// 1. 明确技能意图(审查哪些方面?关注什么?)
// 2. 生成草稿 SKILL.md
// 3. 创建测试用例(好代码/坏代码各几个)
// 4. A/B 测试(有技能 vs 无技能的审查质量)
// 5. 评估 → 迭代 → 发布
// 示例 2:优化已有技能
> 我已经写了一个 SEO 优化技能,帮我测试和改进
// → skill-creator 跳到 Step 4(测试评估)
// → A/B 测试 → 发现问题 → 迭代改进
// 示例 3:验证技能的触发精度
> 我的技能触发不太准,帮我优化描述
// → skill-creator 生成 20 个触发/非触发查询
// → 测试 → 迭代描述 → 提升精度7、什么是一个"好技能"
- ① 意图清晰:技能做什么、怎么工作——一目了然;不是"什么都做"的大杂烩,而是聚焦一个明确目标
- ② 迭代打磨:不是写一次就发布,而是经过多轮测试-迭代;用真实测试用例验证,而非"感觉好就行"
- ③ 效果可量化:用 A/B 数据证明"有技能比无技能好";通过率/延迟/token 效率,有据可查
- ④ 触发精确:描述经过优化——该触发时触发、不该时安静;不误触发、不漏触发
- ⑤ 定性+定量双评估:既看输出质量(定性),又看效率指标(定量);两个维度都达标才算好
8、与 Skills.sh 生态的关系
Skills.sh 生态的三大元技能互相配合,形成完整闭环:
- find-skills(Vercel Labs):搜索和发现技能(用户侧入口)—— "帮我找一个 X 技能"
- skill-creator(Anthropic):创建和测试技能(创作者侧工具)—— "帮我做一个 X 技能"
- Skills.sh 平台(Vercel):发布和分发技能(生态中枢)—— 创建好的技能发布到 Skills.sh,供全球用户安装
生态闭环:用户用 find-skills 发现技能 → 安装使用;创作者用 skill-creator 创建技能 → 发布到 Skills.sh → 用户再通过 find-skills 发现新技能 → 形成"创造→发布→发现→使用→反馈→改进"的正循环。
9、总结
skill-creator 是 Anthropic 官方出品的"用 AI 创建 AI 技能"的元技能(32 万+ 安装,三重安全审计通过)。核心能力是引导你完成技能的完整生命周期:意图捕获 → 草拟 → 测试用例 → A/B 对比测试 → 量化评估 → 迭代 → 扩展验证。最大的技术亮点是A/B 并行测试(有技能 vs 无技能)和描述触发优化(20 个场景、5 轮迭代),确保技能"有效"且"触发准确"。
关键要点:
- 定位:用 AI 创建 AI 技能的"元技能",Anthropic 官方,32 万+ 安装
- 七步工作流:意图 → 草拟 → 测试 → A/B 对比 → 评估 → 迭代 → 扩展
- 核心亮点:A/B 并行测试(有技能 vs 无技能)+ 量化指标(通过率/延迟/token)
- 描述优化:20 个触发/非触发场景 × 5 轮迭代 → 触发精确
- 生态角色:与 find-skills(搜索)+ Skills.sh(商店)构成"创造→发布→发现"闭环
对于想为 AI Agent 生态贡献技能的开发者而言,skill-creator 是"技能工程的 CI/CD 工具"——它把"写一个技能"从"凭感觉写一段 Markdown"升级成"有测试、有数据、有迭代的工程化流程"。就像好的软件需要单元测试和基准一样,好的技能也需要 A/B 对比和量化评估——skill-creator 就是帮你做到这件事的工具。
参考资料: