🎓 一个包装知识库的诞生 — 软包装AI助手

🎓 一个包装知识库的诞生

这不是一份产品说明书——这是我从零开始,让 AI 自己种出一棵知识树的故事

闲暇之余,我用 AI 写了一个关于软包装的网站 elagentpak.com——去年还是手写代码,今年已经被 AI 驱动了。

前几天,我想构建一个 AI 驱动的软包装设计 SKILL。因为还没有接入图形设计模块,我决定从结构设计入手。简单搭建之后跑了多轮测试,结果暴露了设计智能体最普遍的问题——不稳定。大模型在调度时可能跳过某些步骤,每次设计结果都不一样。

现在的模型在训练时已经具备了广泛的知识,但推理时用到的知识对我们来说是一个黑盒——它是不是幻觉,我们无从查证。为了解决这个问题,通常的做法是引入 RAG(检索增强生成),把本地知识库作为大模型的外部知识"外挂"。

考虑到我们的 SKILL 以及其他 SKILL 都需要一个稳定、可审查的知识底座,我决定建立一个世界知识库——公开给所有人,所有 SKILL 共享,必要时可以人工审查知识是否正确。

此前创建 llm-wiki 的经验让我有了技术基础,但这次我决定更进一步——让 AI 自己决定如何创建、如何蒸馏知识。于是我给了 AI 四个目标:

① 从零开始学会包装领域的全部知识;

② 像一位真正的行业专家一样,把知识结构化地沉淀下来;

③ 在用户提问时,精准地掏出一小段而不是甩出一整本书;

④ 并且,这个过程不是一次性的——它得自己生长、自己更新。

AI 首先提出了 8 个顶层领域关键词,再从中派生出 40+ 个种子概念,从种子概念进一步蒸馏出知识点和检索块。在蒸馏过程中,还会不断挖掘出新的种子词——就像一棵树,从根部开始,不断长出枝叶。这就是"包装知识库引擎"的起点。

8
知识领域
40+
种子概念
~500
蒸馏知识点
~2,000
检索块

🌱 第一章:种子词——知识树的根从哪里来

一棵树能不能长好,种子是关键。我们的种子不是拍脑袋想出来的,而是让 AI 像一位走进包装工厂的新人工程师一样,从"最需要知道什么"这个问题出发。

🎯 种子词的诞生

我们给 AI 的第一个任务是:"你是一位刚入职的包装工程师,请列出你必须掌握的核心知识领域。"

AI 没有给我们一堆零散的词汇,它给出的是一棵结构树:

🥇 顶层:领域划分
基材 · 复合工艺 · 印刷 · 阻隔 · 制袋 · 检测 · 法规 · 应用
▼ 每个领域拆出子概念
🥈 中层:核心概念
BOPP薄膜 · 干式复合 · 溶剂残留 · 水氧阻隔 · 三边封制袋 · 热封强度测试 · GB 9685
▼ 每个概念可以继续分解
🥉 底层:知识细节
热封温度窗口 · 涂布量计算 · 剥离力判定 · 摩擦系数影响

🔄 种子词如何自我更新

这批"种子"不是一成不变的——有两种方式会触发种子词的更新:

方式一:蒸馏过程的内部演进

在蒸馏知识的过程中,AI 会重新审视已有知识,发现"遗漏的角落",然后自动补充新的种子词。每一次迭代都会让知识树再长出几条新枝。

方式二:用户提问的外部探测

📝
用户提问触发
用户问到一个知识库未覆盖的问题
🔎
检索命中检测
判断现有知识是否足够回答
🌱
生成新种子词
将未覆盖的概念加入种子列表
🏭
触发蒸馏流程
对新种子词进行知识蒸馏

每一个用户提问都是一次"知识边界探测"——用户问得越多,知识库覆盖得越全。


🌳 第二章:蒸馏——如何把种子词变成结构化的知识库

有了种子,接下来就是让 AI 去"学习"每个概念,并把学到的知识拆成最小的可检索单元。

🏗️ 三层知识结构

我们没有把知识存成一篇篇文章,而是设计了一个三层架构,让每一条知识都像"乐高积木"一样独立可拼:

层级粒度内容用途
🏛️ 领域基材、复合、检测等 8 大类知识库的目录骨架
📋 概念100-200 字精炼摘要
如:"BOPP热封型薄膜的热封温度通常 120-145°C,热封强度≥8N/15mm(QB/T 2358)"
第一步快速检索的"菜单"
🧩 检索块300-500 字自包含段落
含具体数值 + 标准号 + 对比数据
最终返回给用户和 AI 参考的"答案"

⚙️ 数据库更新全流程

每一条新知识进入数据库之前,都会走完下面这趟"产线"——从接收任务到写入数据库,全程自动化:

1
接收任务
种子词 + 领域上下文送入蒸馏队列
2
AI 蒸馏
生成概念摘要 + 3-5 个检索块
强制引用标准号与数值
3
SHA256 去重
计算哈希指纹,比对是否已存在完全相同内容
4
全文判重
在已有库中搜索相似概念,避免"换汤不换药"
5
格式校验
检查是否含标准号、数值范围
模糊描述("较好""较高")会被拒绝
6
写入数据库
存入数据库 + 向量索引,即时可检索

整个过程通常在 几十秒内 完成。新写入的知识可以被后续的所有查询立即检索到。


✍️ 不只是 AI 蒸馏——还有另外两种更新路径

  • 对话沉淀:当用户与 AI 对话中产生了有价值的内容,AI 可以自动判断、去重、结构化,存入知识库。用户问得越多,知识库越聪明。
  • 文档解析:上传技术 PDF / Word / Excel,AI 自动提取材料参数表、工艺流程、检测指标等结构化数据。
  • 联网查证(规划中):蒸馏知识时主动搜索互联网,验证标准号准确性、发现新出现的材料,交叉验证多源信息。

🔍 第三章:检索——如何从两千条知识块中精准找到目标

东西多了,怎么找得到?如果每次提问都把所有知识塞进 AI 的上下文窗口,成本会爆炸。AI 设计了一套渐进式检索策略

🏹 两阶段检索:先瞄再放箭

阶段搜索范围返回内容Token 消耗
第一轮
摘要扫描
所有概念的标题 + 摘要 2-3 个最相关的概念摘要 ~200
第二轮
精确命中
命中概念的检索块集合 1-2 条最匹配的知识块 ~1,500
合计 ~1,700

💡 为什么是渐进式?

虽然现在大模型的上下文窗口越来越广,将全文直接塞给模型已经技术可行,但 Token 消耗太大,响应也会变慢。更重要的是——过长的上下文会稀释大模型的注意力,导致能力下降。因此渐进式加载在 Agent 中已经成为"标准"方案。

  • 第一步像翻目录:只看摘要,快速定位"哪几个概念是相关的"。这一轮几乎不花钱。
  • 第二步像翻到那一页:只在命中的少数概念里,精确检索最贴切的知识块(每块 300-500 字,独立可读)。
  • 最终效果:预计每次查询只消耗 ~1,700 Token,比传统方式节省 88%,同时答案更精准。

🧠 检索的技术骨架

底层使用的是一套全文检索 + 向量检索混合方案:

  • 全文检索:负责第一阶段快速扫描——对标题和摘要做关键词匹配,毫秒级返回候选列表。
  • 向量嵌入检索:负责第二阶段精确匹配——将用户问题转为语义向量,在检索块库(已预先向量化存入)中找语义最接近的块。
  • 关键词 + 语义双路融合:两个结果合并排序,确保既不错过精确术语匹配(如"QB/T 2358"),也不漏掉语义相近但用词不同的内容(如"热封强度" vs "封口牢度")。

🔄 检索触发时机

知识库检索不是每次对话都跑的——只在 AI 判断"需要专业知识支撑"时才触发:

  • 用户问到包装技术参数(如温度、压力、标准值)→ 触发
  • 用户问到工艺对比或选材建议 → 触发
  • 用户问的是产品功能操作问题 → 不触发,走产品文档搜索
  • 纯粹的闲聊或客套 → 不触发,避免无意义调用

🔭 第四章:后续

目前,知识库引擎已经跑通了 "种子词 → AI 蒸馏 → 数据库 → 两阶段检索" 的完整闭环,覆盖了软包装 8 大领域,约 500 个蒸馏知识点和超过 2,000 个可检索知识块。

但真正让人兴奋的,不是现在的规模,而是这套系统的可进化性:它是活的。


⚡ 短期

  • 对话中自动沉淀新知——用户自然是知识边界探测器
  • 行业文档批量导入——让技术手册也能"喂"给知识库
  • 联网查证——AI 蒸馏的不只是"记住的",还能验证"外面的"

🎯 中期

  • 供应商 TDS 材料数据接入——让知识库连上真实的材料世界
  • 智能选材推荐——输入性能要求,输出材料方案
  • 法规实时追踪——食品接触材料标准一变,知识库自动跟进

🌍 长期

  • 多语言并行知识库——中英文知识同一套骨架,各自生长
  • 行业知识图谱——从"问答型"进化为"推理型"
  • 开放百科共建——让包装行业每个人都能贡献和审查知识