📚 系列导航:上一篇 WorkBuddy GEO 品牌诊断专家使用教程 已经完成前一阶段;本篇聚焦把书籍、课程和视频蒸馏成可复用、可测试的 Skill;下一篇 WorkBuddy Excel、网站与跨服务联动案例 继续后续学习。
**先给结论:**摘要解决“这份材料讲了什么”,Skill 解决“遇到什么问题时,该按哪些步骤做”。要把书或视频变成 Skill,关键不是多摘金句,而是提取触发条件、执行步骤、边界和测试用例。
本章使用开源项目 cangjie-skill 说明这套方法。原材料和工具能力可能更新,以项目当前说明为准。

书籍知识无法复用的原因
AI 可能知道一本书的内容,人也可能做过笔记,但遇到真实问题时,双方都未必会主动调用正确框架。问题不只是存储,而是缺少激活路径。
知识蒸馏就是把一大锅内容拆成几个能单独使用的模块:每个模块都说明何时触发、怎样执行、何时别用、如何验收。

它不是三样东西:
- 不是摘要:只压缩原文;
- 不是读书笔记:只重组原文;
- 不是 RAG 索引:只保存片段供检索。
书籍与视频制作 Skill 的六阶段流程
为了消除原流程中“阶段 1.5”的编号歧义,这里统一成 0—5 六个阶段:
整书理解 → 并行提取 → 三重验证 → 构造 Skill → 建立链接 → 压力测试


原文以《文案创作完全手册》为例:

理解书籍或课程的完整结构
先回答主旨、论证链、术语定义和作者局限。跳过这一层直接摘句,容易把作者反对的观点当成结论。

从五个视角并行提取知识
分别提取框架、原则、正面案例、反例和专有术语。

这些角色必须独立产出,最后再合并。否则第一个角色的判断会把其他视角带跑偏。
通过三重验证筛选知识单元
- 跨域验证:至少在两个独立场景中成立;
- 预测力测试:能否推导材料没有直接讨论的问题;
- 独特性检验:是否超出泛泛常识。

原项目经验称,一本书可能先得到 50—100 个候选,筛后保留 10—25 个。这个范围取决于材料密度,不应当作固定指标。
将知识单元构造成 Skill
每个 Skill 至少写清:触发场景、执行步骤、输出格式、不适用边界和质量标准。

触发描述不能只写“需要文案时使用”,而应具体到可观察场景。边界同样重要:适用范围过宽,会让 Skill 在错误场景里主动添乱。
建立 Skill 知识关系网络
标出依赖、对比和组合关系。复杂任务需要的往往是一组 Skill,不是单一文件。

使用正常题和诱饵题测试 Skill
正常题检查能否给出可执行步骤;诱饵题故意提供不适用场景,检查 Skill 能否忍住不触发。

Skill 知识蒸馏产物结构

book-skill/
├── README.md
├── skills/
│ ├── skill-01.md
│ └── skill-02.md
├── index.md
└── tests/
├── skill-01-test.md
└── skill-02-test.md
每个 Skill 文件保存触发、步骤、输出、边界和测试。索引负责描述 Skill 之间的关系。


Skill 和 RAG 不是二选一
| 对比 | RAG | 知识蒸馏 Skill |
|---|---|---|
| 核心动作 | 找相关原文 | 调用可执行方法 |
| 使用方式 | 用户主动查询 | Agent 根据场景匹配 |
| 内容形态 | 原文片段 | 触发、步骤、边界和测试 |
| 更适合 | 查“材料里说了什么” | 做“遇到问题该怎么干” |
可以把 RAG 当图书馆目录,把 Skill 当岗位操作卡。实际系统完全可以同时使用:先用 Skill 决定工作框架,再用 RAG 找事实证据。
原文还对比了 Andrej Karpathy 的 LLM Wiki 思路:Wiki 更偏结构化知识库,蒸馏更偏执行单元,目标不同但并不冲突。
视频先转文字,再进入同一条蒸馏线
cangjie-skill v2 增加了视频蒸馏,可配合 video-downloader:
合法视频链接 → 下载 → 提取音频 → ASR 转写 → 六阶段蒸馏 → Skill 集合

视频下载、转写与知识蒸馏分成两个 Skill,方便独立维护。原文说明视频号受平台限制,暂不支持这套自动下载流程;YouTube、B 站等支持情况也应以当前工具和平台条款为准。
本地 Whisper 能保护数据边界,但长视频耗时较高;ASR API 通常更快,但会把音频交给外部服务。选择前先看隐私、价格和授权。
什么材料值得蒸馏
最适合的是框架清晰、方法密度高的书和课程。访谈、播客可以做,但产物质量取决于内容密度。小说和叙事文学通常不适合,因为它们的价值并不主要来自可拆执行步骤。
建议先读过或看过原材料,再蒸馏。人需要在筛选、边界和测试阶段判断重点,蒸馏不能替代阅读。
成本、优化与复用
长上下文理解、五路提取、多轮验证和压力测试都会消耗大量 Token。原案例给出的耗时与数量只能视为当时样本:例如蒸馏 26 集、约 4 小时的课程,约 1 小时产出 25 个 Skill。模型、硬件、上下文长度和材料结构都会改变结果。

产物可以用测试工具持续迭代,也可以通过仓库分享。但分享前要确认原材料版权、Skill 中是否包含过量原文,以及测试是否覆盖错误触发。
本篇小结
知识蒸馏不是更高级的摘要,而是为知识补上使用说明书。先理解材料,再分视角提取、严格筛选、构造触发与边界、建立关系,最后用正常题和诱饵题测试。只有能在正确场景稳定执行的知识,才算真正变成 Skill。