DiffusionGemma 不再按顺序逐个预测 token,而是并行生成文本块并迭代修正,为低并发本地推理探索新的速度路线。
发布了什么
Google 于 2026 年 6 月 10 日发布实验性开放模型 DiffusionGemma。传统自回归语言模型通常从左到右逐个生成 token,而 DiffusionGemma 会同时处理一整块文本,再通过多轮迭代逐渐修正结果。
为什么这种路线有吸引力
在单用户、本地显卡和低并发场景中,逐 token 生成可能无法充分利用计算资源。官方称 DiffusionGemma 在专用 GPU 上可实现最高约四倍的 token 输出速度,并且双向关注整段内容的方式有利于代码补全、行内编辑和格式修正。
速度并非没有代价
DiffusionGemma 是实验模型,官方也指出其优势主要出现在低到中等批量的本地推理;在高并发云端服务中,自回归模型可以通过批处理充分利用硬件,扩散路线未必更便宜。采用时需要同时评估质量、延迟、显存和吞吐量。
文本扩散的价值不在于立即替代所有大语言模型,而在于重新打开“语言模型必须逐词生成吗”这一基础设计问题。
资料来源
内容版权归 SOSBEI 所有
