6.4 知识库与RAG实施
RAG核心原理
RAG = Retrieval Augmented Generation(检索增强生成)
用户问题 ──→ 检索 ──→ 知识库 ──→ 相关文档片段
│
↓
拼接Prompt
│
↓
LLM生成 ──→ 最终回答
知识库建设五步法
第一步:数据收集
□ 文档类型梳理
├── 内部文档(流程、手册、制度)
├── 外部文档(法规、行业标准)
├── 历史记录(FAQ、案例)
└── 实时数据(数据库、API)
□ 数据量评估
├── 文档数量
├── 总字数
├── 覆盖度
□ 数据质量评估
├── 格式是否规范
├── 内容是否过时
├── 是否需要脱敏
第二步:数据清洗
□ 格式统一
├── 转为Markdown/TXT/PDF
└── 去除特殊格式(复杂表格处理)
□ 去重去噪
├── 删除重复内容
└── 删除无关广告/水印
□ 脱敏处理
├── 去除个人隐私信息
└── 去除商业机密(如需)
第三步:知识切片
□ 切片策略选择
├── 固定长度切片(500-1000 tokens)
├── 按段落切片(自然段落边界)
└── 按语义切片(语义分割模型)
□ 重叠策略
└── 相邻切片重叠10-20%,避免截断语义
□ 元数据标注
├── 来源文档
├── 章节标题
├── 创建时间
└── 关键词标签
第四步:向量化
□ 向量模型选择
├── text-embedding-3-small(OpenAI)
├── BGE-m3(中文,国产)
└── M3E(中文,开源)
□ 向量化配置
├── 向量维度:1536/1024/768
└── 批处理大小:根据数据量设置
第五步:检索优化
□ 检索策略
├── 纯向量检索(语义相似)
├── 关键词检索(BM25)
└── 混合检索(hybrid search)← 推荐
□ 召回参数
├── Top-K:返回5-10条
└── 相似度阈值:0.5-0.7
□ 重排(Re-rank)
└── 使用重排模型对召回结果排序
RAG实施检查清单
□ 知识库覆盖度检查
└── 知识库能覆盖80%以上的用户问题
□ 知识库质量检查
├── 文档是否过时
├── 内容是否准确
└── 是否有知识盲区
□ 切片质量检查
├── 切片是否保留完整语义
└── 切片长度是否合理
□ 检索效果检查
├── 召回率≥80%(相关文档被召回)
├── 准确率≥60%(召回的文档是相关的)
└── Bad case分析
□ 生成效果检查
├── 答案是否基于召回知识
├── 是否存在幻觉
└── 回答格式是否符合要求
知识库维护机制
□ 定期更新
├── 知识库更新频率:根据业务变化速度
├── 增量更新:新增文档快速入库
└── 全量重建:每月/每季度评估是否需要
□ 知识库监控
├── 未召回问题分析(用户问但知识库无相关文档)
├── Bad case知识补充
└── 知识冲突检测
□ 知识库质量评估
├── 定期人工抽检准确率
├── 用户反馈收集
└── 知识库覆盖率统计
觉得有用?分享给创业伙伴或交付团队
这篇内容适合在创业方向判断、客户沟通、项目交付和团队复盘时反复查看。