AI EngineerHarness Engineering 还不够:为什么软件工厂会失败 — Dex Horthy, HumanLayer
Dex Horthy 分享了他的 AI 软件工厂项目因过度依赖模型而失败的教训。他认为,当前编码模型仅针对测试通过进行强化,忽视架构可维护性,导致长期成本累积。他主张回归人工代码审查和前期规划,而非盲目信任 AI。
Dex Horthy 在 2025 年 7 月关闭了他的 AI 软件工厂——一个无人阅读代码的代理工厂。项目最终崩溃,出现了一个无法通过提示修复的问题,导致网站宕机、用户愤怒,而他不得不翻阅三个月未读的代码库。他认为这并非技能或规模问题,也不是 harness 或额外 token 能解决的,而是一个模型训练问题。
编码模型的强化学习只关注一件事:测试是否通过且不破坏其他功能。这种奖励机制不惩罚糟糕的架构,而架构的代价会在数月后显现。因此,模型在通过测试方面越来越强,但在保持代码可维护性方面毫无进步。这解释了为什么 Claude Code 能从零发展到数十亿,而其他使用相同读写编辑命令的工具却未能成功——它是第一个针对其内置 harness 训练的模型。
然而,可维护性远比测试通过更难验证。正如 Horthy 所说,如果模型知道什么是好代码,它早就写出来了。因此,目前我们仍需要亲自阅读代码,这没问题,因为依然可以快速行动。他的解决方案是“重新开灯”,即恢复人工参与:进行产品评审、系统设计、架构审查、代码审查,并制定计划。
对于中文 AI/科技读者而言,这一观点极具警示意义。当前行业普遍追求“AI 替代工程师”,但 Horthy 的失败案例表明,完全依赖 AI 生成代码而忽视人工审查,可能导致灾难性后果。它提醒我们,AI 工具应作为辅助而非替代,尤其是在涉及长期维护的复杂系统中。此外,该讨论触及了 AI 工程化的核心矛盾:如何平衡速度与质量?Horthy 的答案——前期规划与人工监督——或许值得深思。