FlowPod AI
首页
模型路由的现状:NVIDIA、Cognition 与 OpenRouter 的实践与反思
AI Engineer
AI Engineer/未知时间

模型路由的现状:NVIDIA、Cognition 与 OpenRouter 的实践与反思

模型路由AI工程成本优化缓存CognitionNVIDIA
中文导读

模型路由并非简单按任务分派模型,而是需考虑上下文、成本与智能的平衡。NVIDIA、Cognition 与 OpenRouter 的实践表明,小模型在复杂任务中可能因循环调用而成本失控,而前沿模型规划、小模型执行的混合模式更高效。缓存与压缩策略也至关重要。

核心观点
1.小模型在超出训练分布的任务中会陷入循环调用,导致成本超过大模型。(约 0:00)
2.按基准测试路由模型是脆弱的,因为任务会动态演变。(约 5:00)
3.Cognition 采用前沿模型规划、小模型执行的模式,成本降低 40%。(约 10:00)
4.使用单一副驾而非多个子代理,保持 KV 缓存热,降低缓存成本。(约 15:00)
5.压缩(compaction)对智能提升比成本更重要,尽管会引发缓存未命中。(约 20:00)
中文精读

模型路由是 AI 工程中的热门话题,但简单的按任务分派模型可能适得其反。Alex Atallah 指出,在终端基准测试中,Opus 比 Haiku 得分高 3 倍,但成本仅为后者的十分之一,尽管 Haiku 每 token 更便宜。原因在于小模型在超出训练分布的任务中会陷入工具调用循环,导致总成本飙升。这颠覆了直觉:并非所有任务都适合用便宜模型。