FlowPod AI
首页
为什么需要大模型?边缘与机器人上的小模型——Google AI Edge Cormac Brick 访谈
AI Engineer
AI Engineer/2026年7月26日

为什么需要大模型?边缘与机器人上的小模型——Google AI Edge Cormac Brick 访谈

边缘AI小模型Gemma量化微调Google
中文导读

Google AI Edge 团队负责人 Cormac Brick 指出,边缘 AI 的瓶颈不是算力而是内存,且内存问题日益严重。通过量化技术,2B 参数的 Gemma 可在树莓派上运行,而更小的模型(5亿到5000万参数)则能覆盖老旧设备。微调而非提示工程是关键,例如微调后的 Gemma 在函数调用上准确率超86%。离线语音听写应用已商业化,展示了小模型的实际价值。

核心观点
1.边缘 AI 的约束是内存而非算力,且内存问题加剧:手机内存减少,树莓派价格上涨。(约 0:00)
2.量化技术使 2B 参数的 Gemma 能在树莓派上运行,速度约 8 tokens/秒,在 NPU 上可处理视觉任务。(约 5:00)
3.更小的模型(5亿到5000万参数)可运行在老旧设备和廉价硬件上,通常需要微调而非提示工程。(约 10:00)
4.微调后的 Gemma 在十种动作的函数调用上准确率超过86%,结合语音模型可实现语音到函数调用。(约 15:00)
5.已落地的案例:离线语音听写应用,基于两个子十亿参数 Gemma 模型,无需订阅,还能去除语气词。(约 20:00)
中文精读

在 AI 工程领域,大模型风头正盛,但 Google AI Edge 团队负责人 Cormac Brick 的访谈提醒我们,边缘设备上的小模型同样重要。他指出,边缘 AI 的真正瓶颈并非算力,而是内存,且这一挑战正在加剧:手机厂商今年减少了内存配置,而 6GB 树莓派的价格比发布时贵了 2.5 倍。因此,他的团队致力于让模型足够小,以适应这些设备。

具体来说,一个 20 亿参数的 Gemma 模型,通过量化到每权重 2.9 位,可以在树莓派上以约每秒 8 个 token 的速度运行,在骁龙 NPU 上则足以处理每秒几帧的视觉任务。更小的模型,从 5 亿参数到 5000 万参数,可以覆盖老旧笔记本电脑和廉价设备,这些设备连小模型都难以容纳。这些模型通常需要微调而非提示工程,但收益是实实在在的:微调后的 Gemma 能将自由文本转换为跨十个动作的正确函数调用,准确率超过 86%,再加上语音模型,就能实现语音到函数调用。

一个已落地的例子是离线语音听写应用,它基于两个子十亿参数的 Gemma 模型,无需订阅,还能自动去除语气词(如“嗯”“啊”)。这表明,小模型在特定任务上可以高效且实用。

对于中文 AI/科技读者,这个访谈的价值在于:它挑战了“越大越好”的惯性思维,展示了在资源受限场景下,通过量化、微调和模型压缩,小模型也能发挥大作用。这为边缘计算、物联网、机器人等领域的开发者提供了新的思路,尤其是在隐私保护、离线运行和成本控制方面。

下一集
YC合伙人巴黎圆桌:AI时代创业公司的真正护城河是什么?