AI Engineer从Token消耗竞赛到可信吞吐量——Mingsheng Hong谈Ironclad的AI工程实践
AI工程Token消耗可信吞吐量Ironclad工程实践
中文导读
Ironclad AI工程负责人Mingsheng Hong分享如何避免AI使用量竞赛,强调将Token消耗视为烟雾探测器而非排行榜,并引入“可信吞吐量”指标,综合衡量代码行数、PR合并及复杂度,以优化AI工程效率。
核心观点
1.Token消耗仪表板应作为烟雾探测器,而非排行榜,避免团队为竞争而浪费资源。(约 0:00)
2.衡量AI使用量时,成本只是比率的一侧,必须同时衡量价值。(约 5:00)
3.Ironclad的指标演进:从代码行数到合并PR,再到按复杂度加权的合并PR。(约 10:00)
4.可信吞吐量指通过客观检查、人工审查和客户接触的工作,瓶颈已转移到审查和CI环节。(约 15:00)
5.缓慢的CI管道会促使工程师提交大型批量PR,应优化下游流程。(约 20:00)
中文精读
在AI工程实践中,许多团队会建立Token使用仪表板来追踪成本,但Ironclad的Mingsheng Hong提醒,这容易引发内部竞争,导致资源浪费。他将仪表板定位为“烟雾探测器”,用于发现异常,而非排名工具。例如,某团队Token使用量异常低,可能意味着他们未充分利用AI,值得沟通。这一观点与“代码行数”指标类似,追踪有价值,但优化则有害,因为删除代码往往更优。
Ironclad的指标演进体现了对价值的关注:从代码行数到开放PR,再到合并PR,最终采用按复杂度加权的合并PR。因为十行并发修复的价值远超千行样板代码。这种演进在公开中迭代,反映了团队对衡量真实产出的追求。
Mingsheng提出“可信吞吐量”概念,指通过客观检查、人工审查和客户接触的工作。这强调质量而非数量,避免仅优化成本而忽视价值。当前瓶颈已从代码生成转移到审查和CI,缓慢的流水线会促使工程师提交大型批量PR,增加审查难度,降低效率。因此,优化CI和审查流程是提升可信吞吐量的关键。
对于中文AI/科技读者,这一实践提供了可复用的方法论:在AI工具普及后,如何建立合理的度量体系,避免陷入“为用而用”的陷阱。Ironclad的案例展示了从成本导向到价值导向的转变,值得借鉴。
下一集
实测一周:Anthropic Fable 5.1 上手体验