AI Engineer为什么需要大模型?边缘与机器人上的小模型——Google AI Edge Cormac Brick 访谈
Google AI Edge 团队负责人 Cormac Brick 指出,边缘 AI 的瓶颈不是算力而是内存,且内存问题日益严重。通过量化技术,2B 参数的 Gemma 可在树莓派上运行,而更小的模型(5亿到5000万参数)则能覆盖老旧设备。微调而非提示工程是关键,例如微调后的 Gemma 在函数调用上准确率超86%。离线语音听写应用已商业化,展示了小模型的实际价值。
在 AI 工程领域,大模型风头正盛,但 Google AI Edge 团队负责人 Cormac Brick 的访谈提醒我们,边缘设备上的小模型同样重要。他指出,边缘 AI 的真正瓶颈并非算力,而是内存,且这一挑战正在加剧:手机厂商今年减少了内存配置,而 6GB 树莓派的价格比发布时贵了 2.5 倍。因此,他的团队致力于让模型足够小,以适应这些设备。
具体来说,一个 20 亿参数的 Gemma 模型,通过量化到每权重 2.9 位,可以在树莓派上以约每秒 8 个 token 的速度运行,在骁龙 NPU 上则足以处理每秒几帧的视觉任务。更小的模型,从 5 亿参数到 5000 万参数,可以覆盖老旧笔记本电脑和廉价设备,这些设备连小模型都难以容纳。这些模型通常需要微调而非提示工程,但收益是实实在在的:微调后的 Gemma 能将自由文本转换为跨十个动作的正确函数调用,准确率超过 86%,再加上语音模型,就能实现语音到函数调用。
一个已落地的例子是离线语音听写应用,它基于两个子十亿参数的 Gemma 模型,无需订阅,还能自动去除语气词(如“嗯”“啊”)。这表明,小模型在特定任务上可以高效且实用。
对于中文 AI/科技读者,这个访谈的价值在于:它挑战了“越大越好”的惯性思维,展示了在资源受限场景下,通过量化、微调和模型压缩,小模型也能发挥大作用。这为边缘计算、物联网、机器人等领域的开发者提供了新的思路,尤其是在隐私保护、离线运行和成本控制方面。