GLM 自建推理栈:把「3× 吞吐、10 万国产卡、两周上线」拆开核一遍

智谱 2026-09-17 在 z.ai 官方博客发了《Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure》,讲 GLM-5.3-Flash 怎么在十万张国产加速器上自建推理栈。中文圈当天就转开了,但对不齐的不是媒体、是口径:官方中文博客稿写「端到端服务性能约 3 倍」「部分场景的性能差距超过 20%」,唐杰 X 写「3.2× 端到端吞吐」「over 30% to under 1%」。两家转载又都同时用了两套数——量子位导语跟唐杰用 3.2×、正文转官方中文博客稿用 3×;爱范儿同一篇里 3.2× 与约 3 倍并存。同一件事,两套数。 ...

2026年9月18日 · 10 分钟 · 繁星