AI Engineer引用溯源:LLM构建知识图谱的出处问题 — Daniel Chalef, Zep AI
Daniel Chalef 在 AI Engineer 播客中深入探讨了 LLM 构建知识图谱时的出处溯源难题。他指出,当 LLM 从多个来源合成事实时,传统标记方式无法追踪数据来源。他介绍了 Graphiti 框架,通过图结构实现来源追踪、标签继承和合规删除,为 AI 工程提供可调试的透明系统。
在 AI 工程领域,LLM 构建知识图谱时面临一个核心挑战:如何确保合成事实的出处可追溯?Daniel Chalef 在 AI Engineer 播客中直击痛点——当 LLM 从电子病历、实验室报告和患者聊天记录中合成“患者有青霉素过敏”这一事实时,医生无法知道具体来源。传统方法(如给事实打上来源 ID)在实体合并和后续数据更新后失效,因为存储状态不断变化。
Chalef 的解决方案是让出处本身成为图结构。在 Zep 的开源框架 Graphiti 中,每个来源被建模为“事件”,所有派生事实通过有向边链接回来源。这样,追溯一个事实的起源只需一次图遍历。例如,标记一个来源为“已验证临床来源”,该标签会自动继承到所有派生节点和边,使智能体可以只保留来自可信来源的事实。
删除操作同样通过反向图遍历实现:GDPR 要求删除某个来源时,系统会移除该来源节点,并检查每个派生事实是否还有其他来源支持。如果事实仅依赖被删除的来源,则一并删除;否则保留。这为合规性提供了清晰的审计轨迹。
对于中文 AI/科技读者,这个讨论极具价值。国内大模型应用同样面临数据溯源和合规问题,尤其在医疗、金融等强监管领域。Graphiti 的图结构溯源思路提供了一种可落地的工程方案,而不仅仅是理论探讨。此外,Zep 作为开源项目,降低了技术门槛,值得关注。
Chalef 的演讲还强调了可调试性:工程师不再面对黑盒,而是可以通过图结构理解智能体的决策路径。这对于构建可信 AI 系统至关重要。