🎓 一个包装知识库的诞生
这不是一份产品说明书——这是我从零开始,让 AI 自己种出一棵知识树的故事
闲暇之余,我用 AI 写了一个关于软包装的网站 elagentpak.com——去年还是手写代码,今年已经被 AI 驱动了。
前几天,我想构建一个 AI 驱动的软包装设计 SKILL。因为还没有接入图形设计模块,我决定从结构设计入手。简单搭建之后跑了多轮测试,结果暴露了设计智能体最普遍的问题——不稳定。大模型在调度时可能跳过某些步骤,每次设计结果都不一样。
现在的模型在训练时已经具备了广泛的知识,但推理时用到的知识对我们来说是一个黑盒——它是不是幻觉,我们无从查证。为了解决这个问题,通常的做法是引入 RAG(检索增强生成),把本地知识库作为大模型的外部知识"外挂"。
考虑到我们的 SKILL 以及其他 SKILL 都需要一个稳定、可审查的知识底座,我决定建立一个世界知识库——公开给所有人,所有 SKILL 共享,必要时可以人工审查知识是否正确。
此前创建 llm-wiki 的经验让我有了技术基础,但这次我决定更进一步——让 AI 自己决定如何创建、如何蒸馏知识。于是我给了 AI 四个目标:
① 从零开始学会包装领域的全部知识;
② 像一位真正的行业专家一样,把知识结构化地沉淀下来;
③ 在用户提问时,精准地掏出一小段而不是甩出一整本书;
④ 并且,这个过程不是一次性的——它得自己生长、自己更新。
AI 首先提出了 8 个顶层领域关键词,再从中派生出 40+ 个种子概念,从种子概念进一步蒸馏出知识点和检索块。在蒸馏过程中,还会不断挖掘出新的种子词——就像一棵树,从根部开始,不断长出枝叶。这就是"包装知识库引擎"的起点。
🌱 第一章:种子词——知识树的根从哪里来
一棵树能不能长好,种子是关键。我们的种子不是拍脑袋想出来的,而是让 AI 像一位走进包装工厂的新人工程师一样,从"最需要知道什么"这个问题出发。
🎯 种子词的诞生
我们给 AI 的第一个任务是:"你是一位刚入职的包装工程师,请列出你必须掌握的核心知识领域。"
AI 没有给我们一堆零散的词汇,它给出的是一棵结构树:
基材 · 复合工艺 · 印刷 · 阻隔 · 制袋 · 检测 · 法规 · 应用
BOPP薄膜 · 干式复合 · 溶剂残留 · 水氧阻隔 · 三边封制袋 · 热封强度测试 · GB 9685
热封温度窗口 · 涂布量计算 · 剥离力判定 · 摩擦系数影响
🔄 种子词如何自我更新
这批"种子"不是一成不变的——有两种方式会触发种子词的更新:
方式一:蒸馏过程的内部演进
在蒸馏知识的过程中,AI 会重新审视已有知识,发现"遗漏的角落",然后自动补充新的种子词。每一次迭代都会让知识树再长出几条新枝。
方式二:用户提问的外部探测
每一个用户提问都是一次"知识边界探测"——用户问得越多,知识库覆盖得越全。
🌳 第二章:蒸馏——如何把种子词变成结构化的知识库
有了种子,接下来就是让 AI 去"学习"每个概念,并把学到的知识拆成最小的可检索单元。
🏗️ 三层知识结构
我们没有把知识存成一篇篇文章,而是设计了一个三层架构,让每一条知识都像"乐高积木"一样独立可拼:
| 层级 | 粒度 | 内容 | 用途 |
|---|---|---|---|
| 🏛️ 领域 | 粗 | 基材、复合、检测等 8 大类 | 知识库的目录骨架 |
| 📋 概念 | 中 | 100-200 字精炼摘要 如:"BOPP热封型薄膜的热封温度通常 120-145°C,热封强度≥8N/15mm(QB/T 2358)" | 第一步快速检索的"菜单" |
| 🧩 检索块 | 细 | 300-500 字自包含段落 含具体数值 + 标准号 + 对比数据 | 最终返回给用户和 AI 参考的"答案" |
⚙️ 数据库更新全流程
每一条新知识进入数据库之前,都会走完下面这趟"产线"——从接收任务到写入数据库,全程自动化:
强制引用标准号与数值
模糊描述("较好""较高")会被拒绝
整个过程通常在 几十秒内 完成。新写入的知识可以被后续的所有查询立即检索到。
✍️ 不只是 AI 蒸馏——还有另外两种更新路径
- 对话沉淀:当用户与 AI 对话中产生了有价值的内容,AI 可以自动判断、去重、结构化,存入知识库。用户问得越多,知识库越聪明。
- 文档解析:上传技术 PDF / Word / Excel,AI 自动提取材料参数表、工艺流程、检测指标等结构化数据。
- 联网查证(规划中):蒸馏知识时主动搜索互联网,验证标准号准确性、发现新出现的材料,交叉验证多源信息。
🔍 第三章:检索——如何从两千条知识块中精准找到目标
东西多了,怎么找得到?如果每次提问都把所有知识塞进 AI 的上下文窗口,成本会爆炸。AI 设计了一套渐进式检索策略。
🏹 两阶段检索:先瞄再放箭
| 阶段 | 搜索范围 | 返回内容 | Token 消耗 |
|---|---|---|---|
| 第一轮 摘要扫描 |
所有概念的标题 + 摘要 | 2-3 个最相关的概念摘要 | ~200 |
| 第二轮 精确命中 |
命中概念的检索块集合 | 1-2 条最匹配的知识块 | ~1,500 |
| 合计 | ~1,700 |
💡 为什么是渐进式?
虽然现在大模型的上下文窗口越来越广,将全文直接塞给模型已经技术可行,但 Token 消耗太大,响应也会变慢。更重要的是——过长的上下文会稀释大模型的注意力,导致能力下降。因此渐进式加载在 Agent 中已经成为"标准"方案。
- 第一步像翻目录:只看摘要,快速定位"哪几个概念是相关的"。这一轮几乎不花钱。
- 第二步像翻到那一页:只在命中的少数概念里,精确检索最贴切的知识块(每块 300-500 字,独立可读)。
- 最终效果:预计每次查询只消耗 ~1,700 Token,比传统方式节省 88%,同时答案更精准。
🧠 检索的技术骨架
底层使用的是一套全文检索 + 向量检索混合方案:
- 全文检索:负责第一阶段快速扫描——对标题和摘要做关键词匹配,毫秒级返回候选列表。
- 向量嵌入检索:负责第二阶段精确匹配——将用户问题转为语义向量,在检索块库(已预先向量化存入)中找语义最接近的块。
- 关键词 + 语义双路融合:两个结果合并排序,确保既不错过精确术语匹配(如"QB/T 2358"),也不漏掉语义相近但用词不同的内容(如"热封强度" vs "封口牢度")。
🔄 检索触发时机
知识库检索不是每次对话都跑的——只在 AI 判断"需要专业知识支撑"时才触发:
- 用户问到包装技术参数(如温度、压力、标准值)→ 触发
- 用户问到工艺对比或选材建议 → 触发
- 用户问的是产品功能操作问题 → 不触发,走产品文档搜索
- 纯粹的闲聊或客套 → 不触发,避免无意义调用
🔭 第四章:后续
目前,知识库引擎已经跑通了 "种子词 → AI 蒸馏 → 数据库 → 两阶段检索" 的完整闭环,覆盖了软包装 8 大领域,约 500 个蒸馏知识点和超过 2,000 个可检索知识块。
但真正让人兴奋的,不是现在的规模,而是这套系统的可进化性:它是活的。
⚡ 短期
- 对话中自动沉淀新知——用户自然是知识边界探测器
- 行业文档批量导入——让技术手册也能"喂"给知识库
- 联网查证——AI 蒸馏的不只是"记住的",还能验证"外面的"
🎯 中期
- 供应商 TDS 材料数据接入——让知识库连上真实的材料世界
- 智能选材推荐——输入性能要求,输出材料方案
- 法规实时追踪——食品接触材料标准一变,知识库自动跟进
🌍 长期
- 多语言并行知识库——中英文知识同一套骨架,各自生长
- 行业知识图谱——从"问答型"进化为"推理型"
- 开放百科共建——让包装行业每个人都能贡献和审查知识