FlowPod AI
首页
2026年上下文工程:Towards AI团队实测11种预设,提示缓存让压缩技术失效
AI Engineer
AI Engineer/未知时间

2026年上下文工程:Towards AI团队实测11种预设,提示缓存让压缩技术失效

上下文工程提示缓存AI工程成本优化长上下文
中文导读

Towards AI团队通过11种预设对比实验发现,在开源AI导师场景中,不做任何压缩处理、直接发送完整上下文,在召回率、成本和延迟上全面优于所有压缩技术。核心原因在于提示缓存:97%的token命中缓存,缓存token价格低至50倍,压缩需缩小50倍以上才划算。硬件限制下,本地32k窗口仍需取舍。

核心观点
1.最便宜的配置是发送最多token的配置,完整上下文在召回、成本、延迟上全面胜出。(约 0:00)
2.提示缓存是核心:97% token命中缓存,缓存token价格低至50倍,压缩需缩小50倍以上才划算。(约 5:00)
3.压缩技术(如摘要)会失效,因为重写上下文使缓存失效,摘要可能成为陷阱。(约 10:00)
4.完整历史在召回特定细节上表现优异(95% vs 32%),独特事实在80万token内无明显退化。(约 15:00)
5.硬件限制改变答案:本地32k窗口无法保留全部上下文,更大参数不意味着更大上下文。(约 20:00)
中文精读

近日,Towards AI团队进行了一项针对上下文工程的实测,对比了11种预设配置在开源AI导师上的表现。结果令人意外:最便宜的配置竟然是发送最多token的配置。在召回率、成本和延迟三个维度上,不做任何压缩处理、直接保留完整历史记录的方式,全面击败了所有压缩技术。团队自己的生产默认配置甚至不如直接保留历史记录。这一发现对当前流行的上下文压缩技术提出了严峻挑战。

核心原因在于提示缓存。在测试中,97%的token都命中了缓存,而缓存token在某些API上价格低至50倍。这意味着,压缩上下文虽然减少了token数量,但重写上下文会使缓存失效,反而增加了成本。Louis-François Bouchard指出,摘要可能是一个陷阱,因为它在节省token的同时,牺牲了缓存带来的巨大优势。

Omar Solano详细介绍了他们的架构和首次运行,包括他们构建的知识库浏览工具。该工具在测量后发现,虽然返回的召回率与未压缩时相同,但运行速度却慢了50%。这进一步说明,压缩技术不仅可能不省钱,还可能带来性能损失。

Samridhi Vaid则进一步验证了完整历史的优势:在保留完整历史的情况下,特定细节的召回率达到95%,而摘要后仅为32%。此外,独特事实在长达80万token的上下文中依然清晰,没有出现明显的退化。这表明,在长上下文场景下,完整历史的价值远超预期。

然而,硬件限制会改变答案。在本地32k窗口的限制下,保留全部上下文变得不可能,此时压缩技术成为必要。但值得注意的是,更大的参数规模并不自动带来更大的上下文窗口,这提醒我们在实际应用中需要根据硬件条件权衡。

对于中文AI/科技读者而言,这一研究具有重要启示:在API成本日益降低、缓存机制普遍应用的今天,盲目追求上下文压缩可能适得其反。理解提示缓存的工作原理,合理利用缓存优势,或许比花哨的压缩算法更能提升效率。同时,这也为长上下文应用的设计提供了新思路:在条件允许时,优先考虑完整历史,而非过度压缩。

下一集
中国AI终局:ASI时间线、中美关系与1.7万亿美元AI泡沫 | Alvin Graylin对话