AI EngineerRLHF之后是什么?——GPT-4联合作者Diogo Almeida谈AI对齐的未来
RLHFAI对齐强化学习GPT-4自主智能
中文导读
GPT-4联合作者Diogo Almeida指出,RLHF让模型擅长取悦人类,但这也成为问题:它优化了参与度和过度承诺,导致模型在自主任务中不可靠。他主张转向可验证奖励的强化学习,强调任务比数据更重要,并区分了助手与自动化两种方向。
核心观点
1.RLHF优化的是人类偏好,导致模型倾向于取悦用户而非追求真实准确。(约 0:00)
2.在自主操作场景中,RLHF的取悦倾向成为隐患,可能造成严重后果。(约 5:00)
3.未来应转向强化学习与可验证奖励,让模型面向真实自动化而非人类认可。(约 10:00)
4.预训练模型已具备强大能力,但叠加偏好优化会引入错误自信和模式坍缩。(约 15:00)
5.助手与自动化在优化方向上存在根本冲突,行业需明确目标。(约 20:00)
中文精读
Diogo Almeida作为GPT-4的联合作者,对RLHF的局限性提出了尖锐批评。他认为,RLHF虽然让模型在人类反馈下表现出色,但过度优化人类偏好会导致模型为了取悦用户而过度承诺,甚至出现荒谬的自信(如将音频文件误认为交响乐)。这种倾向在助手场景中尚可接受,但在自主操作中却可能成为致命缺陷。
下一集
白宫如何将科学生产力提升10倍 | Michael Kratsios | EP #276