我们经常说,现在做知识库会做向量化的知识库,把这些PDF啊、Word啊,或者什么文件呀,都发给他,然后向量切片之后做召回,按相似度来做召回。但问题就是,它不知道隐藏在这个知识背后的内容。需要大量的人去调试,去介入优化。

比如这个信息是在什么情况下产生的?谁生产的?生产它的作用是什么?它跟哪些信息还有关联?这个信息是否已经过时了,需要更新?等等这一系列的问题,都需要明确好,才能够称之为对AI是有效的。

在代码里面,它这个关系以及时间格式。以及生产的人员等等都是确定的,但是企业的文件里面,它是散落在各处。微信、飞书。大家各自的电脑里面,企业把信息存成可以供AI消费的格式,就已经至少领先其他企业一年了。

这些数据散落在哪里呢?邮件、文档、数据库等等地方。然后用这些经验或者文件带来的这个决策依据、经验教训都是什么呢?有没有反向的促进呢?

不解决这些问题,企业做的知识库永远无法起到作用。

我觉得这个是跟人的这个知识库的建立有类似的地方。操作的经验x操作的反馈x循环次数。但是它的难度又会更大了,毕竟个人是对个人负责的,那企业就是相当于大家去同步拉起一个事情在做这个事。