让你的 AI 帮你建一个「活着的」知识库

你有没有这种感觉:在网上看到一篇好文章,收藏了;

读到一条有价值的推文,截屏了;

遇到一个重要的概念,记在备忘录里了。

然后——再也没有然后了。

碎片化的信息越来越多,真正能用上的却寥寥无几。我们缺的不是信息,而是一个能让信息 自己长起来 的系统。

传统笔记软件搞不定的事

现在大多数人记笔记的方式,大概分这么几类:

  • 文件夹分类 :把笔记塞进文件夹里。问题是,一篇笔记经常涉及多个主题,该放哪儿?
  • 收藏夹吃灰 :浏览器收藏夹里的链接,80% 再也没打开过。
  • RAG (检索增强生成)问答 :RAG简单讲是指将大段文本进行拆分存入向量数据库,在回答时模型会取出与问题最接近的文本进行回答,随着AI时代的到来,直接把文件喂给 AI,问什么答什么。但它的问题是—— 没有积累 。每次问同一个问题,AI 都要重新读一遍原文。

简单说,这些方式都只是 存储 ,而不是 构建 。知识需要被编译、被链接、被持续维护,才能变成真正的知识库。

llm-wiki 的核心理念:一次消化,持续积累

这个系统的思路很直接: 你提供一个素材(链接、文章、文件),AI 把它消化成结构化的知识,存进一个互相链接的 wiki 里。下次有新的知识再进来新内容,它不是在空白基础上重新开始,而是融合到已有的知识网络里。

可以把它理解成一个知识版的"乐高"——每篇新文章是一盒新积木,AI 不是把它整个摆上货架,而是拆开,把有用的零件拼到已有的建筑上。

整个系统的流程其实很简单:

          素材 → AI LLM提取关键概念 → 创建/更新对应页面 → 链接相关概念 → 存入 Wiki
          
        

下次再问关于这件事的问题,AI 不再重新读原始文章,而是直接查已经整理好的 wiki 页面。这就是"编译一次,反复使用"。

具体怎么用?

第一步:初始化

创建一个空白的知识库,包含知识库的主题、方向、空白的首页页

第二步:添加素材

为知识库添加素材,将文本、图片、PDF文件等添加发送给大模型,大模型直接解析或者调用视觉工具对文件进行处理。

第三步:消化素材

完整消化流程大体分两步:

Step 1 — 结构化分析 :AI 读完素材后,提炼出:

  • 这篇文章在讲什么(一句话总结)
  • 涉及哪些核心概念(实体)
  • 属于什么主题
  • 概念之间有什么关联
  • 有没有矛盾信息
  • 哪些是原文明确说的(EXTRACTED),哪些是推理出来的(INFERRED),哪些是 AI 根据背景知识补充的(UNVERIFIED)

Step 2 — 生成页面 :根据分析结果,AI 去更新 wiki:

  • 创建一份素材摘要页(比如 wiki/sources/2026-05-05-什么是Agent.md
  • 创建或更新每个核心概念的实体页(比如 wiki/entities/AI-Agent.md
  • 创建或更新主题页
  • index.md 首页和 log.md 日志里追加新条目
  • [[双向链接]] 语法让相关页面互相引用,比如 什么是Agent.md 里面引用了 AI-Agent.md

重点是:如果某个概念之前已经有过页面,这次不会覆盖,而是 追加新信息 。这样同一个概念在不同素材中的观点会自然汇聚到一起。

比 RAG(检索增强生成) 聪明在哪?

RAG(检索增强生成)是目前很多 AI 问答工具的做法——你问问题,AI 去搜原文,当场读,当场答。好处是省事,坏处是每次从头读, 没有记忆

llm-wiki 的做法像是一个人认真读书做笔记的过程:

RAG llm-wiki
读一遍 每次重读 一次消化
笔记 没有 结构化 wiki
知识增长 没有 持续积累
跨素材关联 靠 prompt 显式链接
速度 越查越慢 越查越快

这里的关键是"编译一次"——就像写代码一样,源代码每次都要解释执行(RAG),当然慢;编译成二进制(wiki)之后,查起来就飞快了。

几个巧妙的细节

缓存机制

你不可能每次都喂同一篇文章。llm-wiki 有一个缓存系统,在处理素材前先检查:这个文件我处理过吗?内容变了吗?

  • 没变化 → 直接跳过,AI 不用浪费算力
  • 内容变了 → 重新处理,更新关联页面
  • 页面被删了 → 重新处理一次

健康检查(lint)

用久了,知识库可能出现一些问题:

  • 孤立页面 :某实体页没被任何其他页面引用(像一座孤岛)
  • 断链[[某个概念]] 但那个页面根本不存在
  • 矛盾信息 :同一概念,来源 A 说东,来源 B 说西
  • 置信度异常 :标记为 EXTRACTED(原文明确说)的内容,实际上在原文找不到

AI 可以定期做健康检查,列出问题并给出修复建议。

这个系统适合谁?

  • 研究者 :读论文、整理文献、梳理领域脉络
  • 写作者 :收集素材、建立概念框架
  • 产品经理 :做竞品分析、整理用户反馈
  • 终身学习者 :任何想把自己读过的东西真正用起来的人

一点启发

我们生活在信息过剩的时代。每天涌进来的内容,如果只是囫囵吞枣地收藏、转发、截图,那它们永远不会变成知识。

llm-wiki 做的事情不复杂—— 给 AI 一个你可以掌控的容器,让它帮你把碎片拼成地图。 你不需要在笔记数量上跟别人比,而是看自己的知识库是否在持续增长、不断链接。

最妙的是:所有文件都是本地 markdown,纯文本,随时可以用 Obsidian、VS Code 甚至记事本打开。你的知识真正属于你,不依赖任何云端服务。

当然,这个系统本身是开源的(MIT 协议),你可以在这里找到源代码: https://clawhub.ai

通过现有的agent工具构建属于自己的知识库