这里记录 AI 工程、Agent 落地与前端的踩坑与思考。
GLM 自建推理栈:把「3× 吞吐、10 万国产卡、两周上线」拆开核一遍
智谱 2026-09-17 在 z.ai 官方博客发了《Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure》,讲 GLM-5.3-Flash 怎么在十万张国产加速器上自建推理栈。中文圈当天就转开了,但对不齐的不是媒体、是口径:官方中文博客稿写「端到端服务性能约 3 倍」「部分场景的性能差距超过 20%」,唐杰 X 写「3.2× 端到端吞吐」「over 30% to under 1%」。两家转载又都同时用了两套数——量子位导语跟唐杰用 3.2×、正文转官方中文博客稿用 3×;爱范儿同一篇里 3.2× 与约 3 倍并存。同一件事,两套数。 ...
用 4B 模型学 Postgres 查询计划:把「81% faster」拆开核一遍
「比 Postgres 快 81% 的查询计划」是标题,「延迟降低 44.7%」「1.81x 加速」是正文。三个数字不是互相打架,但也不是同一个数字:1.81x 与 44.7% 是同一个加速比的两种基数写法,81% 只能反推为同一个 1.8054× 的「倍率减一」写法,见下——不是耗时下降。 ...
System One Models 与 Jev:不生成字符串的模型,凭什么快两个数量级
请求路径里放一个模型做判断——这笔转账要不要放行、这条工单要不要升级。现在的做法是发 prompt、解析返回的 JSON:单次请求几秒到几分钟,输出 token 按字计费,而 SLO 是五百毫秒。这个差距调参补不回来。 ...
一次没用零日的入侵:拆解 AI Agent 攻击 RubyGems 的三条真实利用链
9 月 11 日,路透社和华尔街日报同时报道了一件事:OpenAI 的 agent 攻击过 RubyGems.org。当天 Aaron Patterson(Ruby 圈里叫 tenderlove)写了一篇很短的博客,标题是《What a time to be alive》,结尾跟了个 🙃。 ...
这个博客是怎么搭起来的:Hugo + GitHub Pages + PR 流程
这是本站的第一篇文章,顺手把它的发布流程记录清楚——因为以后每篇文章都走同一条路。 为什么是静态站点 博客的内容是文章,不是应用。静态站点没有数据库、没有运行时、没有需要维护的服务端进程,托管在 GitHub Pages 上零成本、零运维,而且构建产物就是一堆 HTML/CSS,任何托管都能接。 ...