The MAD Podcast with Matt TurckAndy Pavlo:当数十亿 AI Agent 冲击你的数据库会发生什么
CMU 数据库教授、ClickHouse Labs 负责人 Andy Pavlo 在 The MAD Podcast 中讨论 AI Agent 成为数据库最大用户后的连锁反应:从向量数据库只是索引、Agent 自动建库删库,到查询量可能增长 10-100 倍、text-to-SQL 准确率跃升至 99.5%,以及开源数据库大量提交来自编码 Agent。
Andy Pavlo 是 CMU 数据库教授,也是 ClickHouse Labs 的负责人。他在这期 The MAD Podcast 中提出一个值得中文 AI 基础设施读者认真对待的判断:AI Agent 正在成为数据库最大的用户群体,它们创建数据库、查询数据库,有时还会删除数据库。这意味着数据层面对的不再只是人类工程师和传统应用,而是数量可能达到数十亿的自动化行为体。
节目首先纠正了当前 AI 圈对数据库的常见误解。很多人把数据库等同于向量数据库加 RAG,但 Andy 指出向量数据库“只是一个索引”。当 Agent 需要持久记忆、状态管理、事务一致性和复杂查询时,真正的数据库能力才重新变得关键。把 AI 的数据层简化为向量检索,会低估 Agent 规模化后对基础设施的压力。
更具体的变化体现在负载上。如果数十亿 Agent 持续读写,查询量可能增长 10 到 100 倍,数据库的并发、延迟和成本模型都会被重写。同时,Agent 自主创建和删除数据库,意味着权限、审计、备份和资源隔离需要新的默认设计。节目还讨论了 Agent 的记忆应该放在文件还是数据库,这直接关系到可移植性、可观测性和长期维护成本。
text-to-SQL 的进展是另一个亮点。准确率从约 60% 提升到 99.5%,让自然语言查询数据库从演示走向可用。Andy 还提到,约 60% 的开源数据库提交已来自编码 Agent,说明 Agent 不仅在用数据库,也在参与数据库本身的开发。这些趋势对中文 AI 工程师、数据平台团队和基础设施创业者都有直接参考价值。
最后,Andy 把十年自动驾驶数据库研究的经验带入讨论:数据库自治、自动调优和自动运维曾被视为长期方向,而 Agent 时代可能加速这些能力的落地。节目还涉及 ClickHouse、Postgres、向量/图/GPU 数据库的 verdict,以及 Larry Ellison 和 Wu-Tang Clan 等轻松话题。对关注 AI Agent 与数据层交汇的读者,这是一期信息密度很高的对话。