AI Notes

观察 · 上海

Groq 3 LPX 量产:快的是吐字,不是整条代理环

8 月 24 日 Hot Chips,NVIDIA 宣布 Groq 3 LPX 量产,作为 Vera Rubin 的交互延伸。Gemma 4 31B、十万上下文,Artificial Analysis 在 NVIDIA 自己的系统上测到中位 3431 output tok/s。Nebius 是首个计划接入的云。

8 月 24 日,Hot Chips。NVIDIA 宣布 Groq 3 LPX 量产。它不是另一张把模型训得更大的卡。新闻稿把它放在 Vera Rubin 旁边,叫交互推理的延伸,要拉高的是单个用户吐出 token 的速度。Nebius 被写成第一个准备把它放进 Token Factory 的云。旁边的数字,新闻稿收成大约 3400:Gemma 4 31B,十万 token 上下文。技术博客写得更细,Artificial Analysis 在 NVIDIA 自己机房的系统上,中位是 3431 output tok/s。

数字大,容易被读成代理因此快了多少倍。快的是这一条路径上的吐字。

TL;DR:量产把交互速度做成可采购的东西。3431 tok/s 是一只 31B 稠密模型、在 NVIDIA 自己的机器上、单用户、十万上下文的中位输出。它不是 Nebius 上的实测,也不是整条代理环的时间。

上下文和出 token,本来就是两段饥饿

代理要自己走很多步,推理就不是一次长生成。先把上下文吃进去,再把下一步尽快吐出来。上下文决定它眼前能留多少历史、工具结果和失败。输出速度决定下一个动作说出来要多久。系统可以记得很长但每步很钝,也可以吐字极快但记不住上一段为什么失败。

NVIDIA 把 Groq 3 LPX 说成 Vera Rubin 的延伸,不是替代,就是平台要同时有两种形状。一种承担大规模的计算和上下文,一种专门把单用户的生成拉高。新闻稿选 Gemma 4 31B 这个点,是在为后一段做展示,并用十万上下文表示前一段没有被牺牲到不能看。展示可以是一次真实测量。测量仍有边界。工具往返、检索、排队、人的确认,都不在 tok/s 里面。

被拿来展示的还不是最大的旗舰,是一只 31B 的稠密模型。交互延伸的第一批说服对象,可能是已经够用、却被生成速度卡住的模型。旗舰又强又慢的时候,循环里的大量步骤仍会让给更快的一档。速度不只是手感。它参与决定哪一类模型真的活在循环里。

首个云是计划,测速发生在别人的机房

Hot Chips 上若只说芯片能跑,这还是会场新闻。新闻稿写的是量产,并点名 Nebius。Nebius 自己的帖子说,Vera Rubin NVL72 和 Groq 3 LPX 会跑在已有的 Token Factory 上,先支持一部分模型,开发者不用换 SDK。这是接入计划。3431 不是在 Nebius 上跑出来的。Artificial Analysis 测的是 NVIDIA 立在自己数据中心里的那套系统。

把「首个云」读成「云上已经有了这个速度」,会把两件事焊死。量产意味着这种速度开始有供给,而不只是大会上的一次演示。供给先以可租用的形态出现,别人不必先拥有一条产线。租到之前,速度样本的主人仍是 NVIDIA 的机房。

这对代理产品仍然比再多一个榜单数字大。编码代理和必须在墙钟耗尽之前走完的长任务,瓶颈叙事原先集中在够不够聪明、上下文够不够长、每百万 token 多少钱。Groq 3 LPX 把另一项抬上来:单用户的生成速度够不够支撑交互,而不只是批处理。批处理可以等。人看着的循环不能等。等 Token Factory 真能选到它,分档才会从口号变成路由:哪些步骤走慢而强的模型,哪些步骤只需要尽快吐出下一个结构化动作。

更快以后,人更看不完中间步

更快的出 token 通常被写成纯粹的好处。对代理,它也压缩人介入的窗口。每一步若很快成形,逐步确认会从谨慎变成产品上不可行,自动往下走会变成默认。8 月 24 日没有把停机和权限一起发布。它发布的是时间预算:很多步变得可想象,逐步盯着看变得更难想象。

Nebius 把问题从芯片规格推进到租用条款,但是「将要」。次序常常如此。先让循环跑得动,旧的监督界面才会明显不够用。Groq 3 LPX 不负责修补那个不够用。它负责让不够用从未来的顾虑,变成一条已经量产、正在被云接进去的路径。

接下来不该只问会场上还有没有更快的数。该问的是,哪些步骤真的需要这个速度,哪些步骤在这个速度下已经不该再等一个人点头。上下文和出 token 拆开之后,硬件故事才和代理的产品故事是同一种形状。在拆开之前,3400 只是一个很好看的中位数。

参考

事实、出处或判断有误,欢迎 写信纠错或补充 。

返回目录