站内精选
核心结论:答案是值得试试。我用cangjie-skill这个开源项目,把读过的书、看过的长视频和播客做了一次“知识蒸馏”,生成能被AI直接调用的知识库。这套方法的本质是**高效整理信息**,整个过程我实操下来,基础流程半天就能跑通。

为什么你需要一套“内容蒸馏”的方法

我观察到一个普遍现象:很多人收藏了大量“以后再看”的文章、视频和播客,但真正需要调用这些信息时,往往找不到。你记得某本书里提过一个观点,但就是想不起来在哪一页;你听过一期播客讲时间管理,但具体方法已经模糊了。这是因为**信息堆积不等于知识内化**。

我在实操中发现,GitHub上热度不错(6.7K Star)的开源项目cangjie-skill,提供了一种新的思路:与其让大脑去记忆零散信息,不如把书籍、长视频、播客的精华内容“蒸馏”成结构化知识块,然后作为背景知识注入到AI工具中。这样,你相当于给AI配备了一套专属的“知识外挂”,提问时能直接获得基于你阅读材料的精准回答。

核心方法:把任何内容变成AI工具的4个关键步骤

这套方法的难点不在于技术,而在于**如何定义“精华”**。以下是我提炼出的实操框架:

延伸阅读:全网走红!GitHub上6.7K Star的开源项目,把任何书、长视频、播客蒸馏成AI工具,值得收藏 cangjie-skill

  1. 明确蒸馏目标:先用一句话回答“我要从这份内容里得到什么”。比如看一本书,目标是提取“方法论框架”还是“典型案例”?这决定了后续裁剪的侧重点,避免信息过载。
  2. 内容解构与标注:把原始材料(书PDF、视频字幕、播客逐字稿)按章节或时间轴切分。不要大段复制,而是用简练的语言概括每个小节的中心论点。关键结论、反常识观点、可执行指令需要单独标注。我习惯用“结论+论据+操作”的格式来压缩。
  3. 格式化入库:将加工后的文本整理成Markdown或JSON格式,分成“概念库”和“行动库”两个维度。项目cangjie-skill中提供的工具链(如配合Python脚本)能帮你在本地完成清洗和去重。
  4. 接入AI工作流:将处理好的文本文件作为知识库路径,指定给支持本地知识库的AI客户端(如Cherry Studio、Obsidian插件等)。这样每次问答,AI都会自动检索这些内容作为参考。

第一步准备:需要哪些条件以及耗时

很多人会问这种尝试需要多久、需要编程基础吗?根据我的经验,完全零基础可能需要一个下午(约3-4小时),而熟悉命令行操作的用户,1小时内即可完成环境搭建。

你需要准备的东西很轻量:

  • 一台能正常联网的电脑,安装了Python环境(3.8及以上版本即可)。
  • 想要蒸馏的原始文件:书(PDF/EPUB均可)、视频(可通过剪映或飞书妙记导出逐字稿)、播客(音频可先转文字)。
  • 目标明确的问题列表(这是很多人忽略的准备,它决定了你的蒸馏边界)。

我建议第一次尝试时,不要选厚书,选一篇3万字左右的深度长文或一期播客逐字稿。流程跑通后,你会发现处理“大部头”的时间成本主要体现在阅读和概括上,而非技术操作。

第二步实操流程:从一本书到专属AI工具

关于具体怎么做,我复盘一下自己处理《卡片笔记写作法》这本书的完整过程,供你参考。

  1. 材料清洗:利用Calibre将EPUB转为TXT,通过脚本去除页眉页脚和多余空行。视频和播客同理,保留发言人标识。
  2. AI辅助粗筛:将章节内容粘贴给通用AI大模型,输入指令:“请提取本章的核心概念、方法论步骤和反常识结论,输出为一级标题列表”。这一步主要是生成骨架。
  3. 人工二次精炼:对照原书目录,把AI概括的条目中过于笼统的表达删掉。例如AI概括为“强调写作的重要性”,我会手动修改成更具体的“用自下而上的方式组织想法,而非自上而下的主题分类”。这是精华所在,也是与纯文本摘要拉开差距的地方。
  4. 构建索引文件:将精炼后的内容保存为“书中概念.md”,并在文件头部加上“# 书籍蒸馏库”标签。如果内容较多,可以用项目提供的自动索引脚本生成目录树。
  5. 挂载到AI对话窗口:在支持知识库引用的客户端中,指定该文件为系统提示词或RAG(检索增强生成)源。之后提问“如何给文档建索引”,AI会基于这本书的理论而非模糊记忆回答。

常见避坑点与高频提问深度解析

我在实际使用中遇到一些坑,这里集中说明,也是被问得最多的问题。

避坑1:只做“收藏型”蒸馏。把原文高亮保存下来,没有压缩观点,这会导致AI检索结果依然冗长,失去效率优势。请务必执行“总结、提炼、重组语言”的动作。

避坑2:贪多求全。一次性把20本书扔进知识库,AI会陷入“信息混淆”,给出平庸甚至错误的综合答案。建议按主题建库,每个库不超过10本同领域书籍。

避坑3:忽略更新与纠错。AI工具回答错时,要把正确答案顺势补进知识库,让AI越用越懂你。

关于适合什么人:这套方案最适合“知识工作者”,如产品经理、研究者、自媒体写手。对学生而言,用来整理错题集和考点也很有效。不太适合纯粹追求休闲听书体验的人,因为蒸馏过程需要主动思考。

关于需要多久:如果是快速阅读(每天2小时),处理一本200页的书通常需要2到3个晚上。长视频或电影精讲,字幕比较清晰,处理速度更快,一部2小时的电影大约需要40分钟即可完成蒸馏到入库。

另一个常见问题是:这样做会不会侵犯版权?我的经验是,**蒸馏的核心是提取观点和结构化笔记,而非复制原文句子**。输出内容不涉及整段原文,仅作为个人学习和研究用途,这一点在国内社区是比较普遍认可的。

总结与下一步建议

cangjie-skill这个开源项目其实是一把钥匙,它让我解锁了“如何让AI更懂我”的钥匙。核心思路是**化被动收藏为主动加工**,把静态的内容变成动态的知识服务。与其纠结工具的Star数,不如马上拿手边的一篇长视频字幕练手。

我的心得是:工具只负责帮你管理知识,而判断哪些知识重要,永远是你的核心能力。

你用这种方式打造过自己的AI知识库吗?最想先把哪本书或哪期播客放进去?欢迎在评论区聊聊你的计划。

本文更新于 2026-08-11,内容基于实际经验整理。

常见问题解答

cangjie-skill适合什么人群使用?

如果你有大量阅读或听播客的习惯,且需要快速检索笔记,比如知识博主、产品经理、学生,它很适合。如果你只是偶尔看一篇长文,没必要特意搭建环境。

搭建这个本地知识库工具需要多久?

技术背景较弱的情况下,建议预留出3小时学习路径。纯操作层面,克隆项目到本地并跑通示例约15分钟,但理解覆盖和清洗逻辑需要更多时间。

书和视频导出的文字很大,直接扔给AI行不行?

不行,效果会很差。AI上下文有限,缺少焦点。正确做法是先切分为每章/每20分钟为节点,先总结成大纲,再选取重点段落蒸馏,最后合并入库。

蒸馏后的内容如何判断质量好坏?

一个实用的检验标准是:你应该能只看蒸馏稿,就能复述出这本书的2-3个核心方法论,并知道在什么场景下用什么底层逻辑。如果还要返回原文查证,说明蒸馏得还不够。

怎么做才能让AI回答时优先引用我蒸馏的内容?

在提问时携带指令词“根据我提供的知识库回答”,或者在客户端内调整RAG检索的阈值,并降低全局模型的默认权重。此外,蒸馏文件的命名和内部层级越清晰,越容易被优先检索命中。


你可能还想看

发表回复

后才能评论