让你的 AI 帮你建一个「活着的」知识库
你有没有这种感觉:在网上看到一篇好文章,收藏了;
读到一条有价值的推文,截屏了;
遇到一个重要的概念,记在备忘录里了。
然后——再也没有然后了。
碎片化的信息越来越多,真正能用上的却寥寥无几。我们缺的不是信息,而是一个能让信息 自己长起来 的系统。
传统笔记软件搞不定的事
现在大多数人记笔记的方式,大概分这么几类:
- 文件夹分类 :把笔记塞进文件夹里。问题是,一篇笔记经常涉及多个主题,该放哪儿?
- 收藏夹吃灰 :浏览器收藏夹里的链接,80% 再也没打开过。
- RAG (检索增强生成)问答 :RAG简单讲是指将大段文本进行拆分存入向量数据库,在回答时模型会取出与问题最接近的文本进行回答,随着AI时代的到来,直接把文件喂给 AI,问什么答什么。但它的问题是—— 没有积累 。每次问同一个问题,AI 都要重新读一遍原文。
简单说,这些方式都只是 存储 ,而不是 构建 。知识需要被编译、被链接、被持续维护,才能变成真正的知识库。
llm-wiki 的核心理念:一次消化,持续积累
这个系统的思路很直接: 你提供一个素材(链接、文章、文件),AI 把它消化成结构化的知识,存进一个互相链接的 wiki 里。下次有新的知识再进来新内容,它不是在空白基础上重新开始,而是融合到已有的知识网络里。
可以把它理解成一个知识版的"乐高"——每篇新文章是一盒新积木,AI 不是把它整个摆上货架,而是拆开,把有用的零件拼到已有的建筑上。
整个系统的流程其实很简单:
素材 → AI LLM提取关键概念 → 创建/更新对应页面 → 链接相关概念 → 存入 Wiki
下次再问关于这件事的问题,AI 不再重新读原始文章,而是直接查已经整理好的 wiki 页面。这就是"编译一次,反复使用"。
具体怎么用?
第一步:初始化
创建一个空白的知识库,包含知识库的主题、方向、空白的首页页
第二步:添加素材
为知识库添加素材,将文本、图片、PDF文件等添加发送给大模型,大模型直接解析或者调用视觉工具对文件进行处理。
第三步:消化素材
完整消化流程大体分两步:
Step 1 — 结构化分析 :AI 读完素材后,提炼出:
- 这篇文章在讲什么(一句话总结)
- 涉及哪些核心概念(实体)
- 属于什么主题
- 概念之间有什么关联
- 有没有矛盾信息
- 哪些是原文明确说的(EXTRACTED),哪些是推理出来的(INFERRED),哪些是 AI 根据背景知识补充的(UNVERIFIED)
Step 2 — 生成页面 :根据分析结果,AI 去更新 wiki:
-
创建一份素材摘要页(比如
wiki/sources/2026-05-05-什么是Agent.md) -
创建或更新每个核心概念的实体页(比如
wiki/entities/AI-Agent.md) - 创建或更新主题页
-
在
index.md首页和log.md日志里追加新条目 -
用
[[双向链接]]语法让相关页面互相引用,比如什么是Agent.md里面引用了AI-Agent.md
重点是:如果某个概念之前已经有过页面,这次不会覆盖,而是 追加新信息 。这样同一个概念在不同素材中的观点会自然汇聚到一起。
比 RAG(检索增强生成) 聪明在哪?
RAG(检索增强生成)是目前很多 AI 问答工具的做法——你问问题,AI 去搜原文,当场读,当场答。好处是省事,坏处是每次从头读, 没有记忆 。
llm-wiki 的做法像是一个人认真读书做笔记的过程:
| RAG | llm-wiki | |
|---|---|---|
| 读一遍 | 每次重读 | 一次消化 |
| 笔记 | 没有 | 结构化 wiki |
| 知识增长 | 没有 | 持续积累 |
| 跨素材关联 | 靠 prompt | 显式链接 |
| 速度 | 越查越慢 | 越查越快 |
这里的关键是"编译一次"——就像写代码一样,源代码每次都要解释执行(RAG),当然慢;编译成二进制(wiki)之后,查起来就飞快了。
几个巧妙的细节
缓存机制
你不可能每次都喂同一篇文章。llm-wiki 有一个缓存系统,在处理素材前先检查:这个文件我处理过吗?内容变了吗?
- 没变化 → 直接跳过,AI 不用浪费算力
- 内容变了 → 重新处理,更新关联页面
- 页面被删了 → 重新处理一次
健康检查(lint)
用久了,知识库可能出现一些问题:
- 孤立页面 :某实体页没被任何其他页面引用(像一座孤岛)
-
断链
:
[[某个概念]]但那个页面根本不存在 - 矛盾信息 :同一概念,来源 A 说东,来源 B 说西
- 置信度异常 :标记为 EXTRACTED(原文明确说)的内容,实际上在原文找不到
AI 可以定期做健康检查,列出问题并给出修复建议。
这个系统适合谁?
- 研究者 :读论文、整理文献、梳理领域脉络
- 写作者 :收集素材、建立概念框架
- 产品经理 :做竞品分析、整理用户反馈
- 终身学习者 :任何想把自己读过的东西真正用起来的人
一点启发
我们生活在信息过剩的时代。每天涌进来的内容,如果只是囫囵吞枣地收藏、转发、截图,那它们永远不会变成知识。
llm-wiki 做的事情不复杂—— 给 AI 一个你可以掌控的容器,让它帮你把碎片拼成地图。 你不需要在笔记数量上跟别人比,而是看自己的知识库是否在持续增长、不断链接。
最妙的是:所有文件都是本地 markdown,纯文本,随时可以用 Obsidian、VS Code 甚至记事本打开。你的知识真正属于你,不依赖任何云端服务。
当然,这个系统本身是开源的(MIT 协议),你可以在这里找到源代码: https://clawhub.ai
通过现有的agent工具构建属于自己的知识库