规则回答得很好,但AI无法回答业务问题
如果将RAG聊天机器人制作为公司内部文件,一开始可能会非常有用。假期规定、福利制度、工作手册 — 对员工的问题很快就能回答。但是过了一段时间,高管们会问这样的问题:"那么这个AI对我们的销售有什么帮助呢?"
这时就会遇到困难。只输入公司内部文件的RAG只能了解公司内部事务。竞争对手最近以多少价格出售,我们新产品的评价反应如何,市场上有什么传言 — 业务决策所需的大部分信息都是公司外部数据,而RAG中却没有任何这方面的内容。
本文不是关于如何'连接RAG',而是关于'应该放入什么数据,以及如何保持更新'。技术集成已经有很多指南,因此这里从策划者的角度来看待。
外部数据将RAG转变为业务工具
即使是相同的RAG,根据放入的内容,可以回答的问题的级别也会有所不同。
| 放入的数据 | 可以回答的问题 |
|---|---|
| 只有公司内部文件 | "出差费用规定是什么?" |
| + 竞争对手价格·产品 | "与竞争对手相比,我们的价格在哪里受阻?" |
| + 客户评价·VOC | "最近我们的产品投诉主要集中在哪个方面?" |
| + 市场·新闻 | "本周行业中有与我们相关的问题吗?" |
越往下,高管感兴趣的问题就越多,而要回答这些问题,必须有外部数据。RAG的价值不在于模型,而在于放入数据的范围。
真正的问题在于'新鲜度'
如果决定放入外部数据,下一个难题就是新鲜度。公司内部规定可能每几个月变化一次,但竞争对手的价格每天都在变化,评价每小时都在积累。一旦放入并被忽略的外部数据会很快变得无用。
- 回答以前价格的AI会自信地给出错误答案 — 这比不知道更危险。
- 如果过时的答案出现一两次,业务部门就不会信任AI,运营服务也会基本上结束。
因此,将外部数据放入RAG需要设计为"更新运营"而不是"放入项目"。关键在于持续更新而不是初始加载。
通过'收集周期'设计新鲜度
新鲜度不是模糊地说"经常更新",而是确定每种数据类型所需的周期问题。
根据数据性质划分周期
- 快速变化的内容(价格·库存·排名): 需要每天更新
- 中等速度(评价·帖子): 每天到每周更新
- 缓慢的内容(企业信息·目录): 每周到每月更新
将更新委托给管道
需要创建一个结构,使收集 → 清洗 → 更新向量数据库自动运行。手动输入的方式无法持续几周。
检测过时数据
记录最后更新时间,并在更新中断时发出警报。将"数据采集时间"作为回答依据一起显示,可提高可信度。
当这三点齐备时,新鲜度就成为可管理的指标,RAG即使经过时间也不会过时。
未经整理的原始数据不能直接放入RAG
还有一件事。如果直接将爬取的原始数据推送到向量数据库中,搜索质量会下降。重复文档会污染答案,格式各异的值无法比较,多语言评论如果不经处理就无法搜索。
因此,在收集和RAG之间需要一个整理层。通过去重、格式标准化以及情感·分类·翻译等AI分析,为原始数据赋予结构,搜索变得更准确,过滤也变得可能。Hashscraper通过将这种整理·分析应用于收集的数据,可以将其以RAG可直接使用的形式传递给API·数据库。定期收集周期就是RAG的新鲜度周期。
常见问题
Q. 外部数据连接不是技术问题吗?为什么首先是规划?
连接本身可以通过现有指南解决。但是,即使技术完美,如果错误地确定了'放入什么数据以及何时放入',仍会得到过时的答案。新鲜度设计是规划决策,而不是技术问题。
Q. 需要多频繁地更新数据?
根据数据性质而定。像价格·排名这样经常变化的数据需要每天更新,而像企业信息这样变化缓慢的数据则需要每周到每月更新。根据对象划分周期设计,可以平衡成本和新鲜度。
Q. 收集的数据可以直接放入我们的向量数据库吗?
经过整理后是可以的。去重、格式标准化和AI分析后的数据可以通过API·数据库传递到内部管道,然后加载到向量数据库中,这是一种常见的做法。
值得一读的文章
- 将网络爬虫数据连接到RAG的实用指南
- 为什么AI PoC在演示中停滞不前 — 问题在于数据供应链而不是模型
- 将收集的评论附加到AI分析 — 通过情感分析·分类·翻译阅读VOC的方法
- 从爬取数据到决策的过程
立即开始
需要将外部数据放入RAG吗?告诉我们需要哪些数据以及如何保持新鲜,我们将一起设计收集·整理·更新结构。




