FlowPod AI
首页
大语言模型是如何训练的?DeepMind专家详解预训练与后训练
Google for Developers
Google for Developers/2026年7月22日

大语言模型是如何训练的?DeepMind专家详解预训练与后训练

大语言模型预训练后训练DeepMind强化学习Google AI
中文导读

DeepMind专家Nikita Namjoshi深入解析LLM训练的两大核心阶段:预训练通过下一个词预测构建基础能力,后训练则通过监督微调、强化学习和自动评估器将其优化为安全有用的助手。适合中文AI从业者理解前沿训练流程。

核心观点
1.预训练阶段通过下一个词预测任务让模型学习语言模式和知识。(约 0:00)
2.后训练包括监督微调、强化学习等步骤,提升模型的安全性和有用性。(约 5:00)
3.自动评估器(Autoraters)在后训练中起到关键作用,用于评估模型输出质量。(约 10:00)
4.Google AI和Gemini等产品应用了这些训练方法。(约 15:00)
中文精读

DeepMind专家Nikita Namjoshi在Google for Developers的演讲中,系统拆解了大语言模型训练的两大核心阶段:预训练和后训练。预训练通过海量文本上的下一个词预测任务,让模型学习语言结构、事实知识和推理能力,奠定基础。后训练则在此基础上,通过监督微调(SFT)让模型学会遵循指令,再结合强化学习(RL)和自动评估器(Autoraters)进一步优化,使其成为安全、有帮助的助手。

对于中文AI从业者而言,理解这一流程至关重要。预训练决定了模型的知识广度和语言能力,而后训练则直接关系到模型在实际应用中的表现和安全性。Nikita特别强调了自动评估器的作用,它们可以替代人工评估,加速模型迭代,这是当前业界关注的热点。

演讲中提及了Google AI和Gemini等产品,表明这些技术已在实际系统中落地。中文开发者可以从中借鉴如何构建高效的训练流水线,尤其是在后训练阶段如何平衡模型的有用性和安全性。

虽然演讲未提供具体技术细节,但整体框架清晰,适合作为入门或复习材料。对于关注LLM训练技术的中文读者,这是一次了解前沿实践的绝佳机会。

下一集
为什么雄心勃勃的创业想法反而更容易推销 | PostHog CEO James Hawkins 在 Startup School Paris 的分享