返回博客

Ox Alpha 身份揭晓:它就是 GLM-5.3-Flash

Ox Alpha 已不再神秘。Z.AI 确认这个 OpenRouter 隐身模型是 GLM-5.3-Flash 的早期版本,本文梳理时间线、价格、100 万上下文与开源权重。

更新于 2026年8月27日Yix TeamYix Team
Ox Alpha 身份揭晓:它就是 GLM-5.3-Flash

Ox Alpha 已经不是匿名模型。Z.AI 在 2026 年 8 月 26 日确认,OpenRouter 和 OpenCode 上的这个隐身模型,是 GLM-5.3-Flash 的早期版本。

这条更新改变了此前所有评测的阅读方式。免费、匿名和社区“猜模型”属于发布故事;现在真正值得评估的产品已经有正式名称、API 文档、价格、可下载权重和许可证。

一句话概括:Ox Alpha 是公开压力测试,GLM-5.3-Flash 才是正式版本。

Ox Alpha 时间线

8 月 20 日,stealth/ox-alpha 出现在 OpenRouter。页面给出的卖点包括约 100 万 Token 上下文、超长输出、视觉输入,以及编程和长时间 Agent 任务。预览期免费,但开发者身份没有公开。

开发者很快开始测试代码能力、比较 tokenizer 特征并推测模型家族。那些分析提供了线索,却不能当成证明:匿名接口可能随时更换路由和配置,直接问模型“你是谁”也经常得到错误答案。

六天后,Z.AI 给出结论。GLM-5.3-Flash 官方发布文说明,公司在正式上线前,以 Ox Alpha 名义在 OpenCode 和 OpenRouter 做匿名测试并收集反馈。Bloomberg 经 Yahoo Finance 发布的报道也记录了 Z.AI 的确认。

预览版与正式版仍要分开看。Ox Alpha 是早期构建和临时服务配置,那一周的测试能说明真实流量下的表现,却不能代表长期价格、SLA 或最终模型的精确能力。

GLM-5.3-Flash 是什么

GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型。官方模型卡显示,它有 320B 总参数,每个 Token 激活 18B 参数。

Z.AI 称它从新的基础模型开始训练,使用 30 万亿 Token 多模态语料,架构结合稀疏注意力与线性注意力,并引入 Manifold-Constrained Hyper-Connections。简单理解:它保留很大的总容量,但每次只激活一部分,并试图降低长上下文的推理成本。

官方 API 支持 100 万 Token 上下文。图片通过 image_url 内容块传入,可使用公网 URL 或 base64,也能在一条消息中放多张图。视觉能力被放进编程与 Agent 循环中,让模型查看界面或渲染结果,再继续修改。

它是推理与理解模型,输出文字,不是图片或视频生成器。

揭晓后的价格

Ox Alpha 免费周只是预览活动,并非永久定价。Z.AI 官方价格页列出的 GLM-5.3-Flash 价格为:

Token 类型每百万 Token 原价活动价
输入$0.15$0.075
缓存输入$0.03$0.015
输出$0.50$0.25

五折活动计划于 2026 年 9 月 9 日 24:00(UTC+8)结束。做长期预算时应使用原价;如果从第三方平台调用,也应按该平台当前路由和条款计算,而不是默认等同于 Z.AI 直连接口。

GLM-5.3-Flash 的原价仍明显低于完整 GLM-5.3 的 $1.40 输入和 $4.40 输出。但低单价不等于低总成本:无效重试、长 Agent 循环、塞满上下文和冗长推理都可能放大账单。

开源权重与自部署

Z.AI 已在 Hugging Face 发布权重,许可证为 MIT,官方支持 SGLang、vLLM 和 KTransformers 等部署方式。

开放权重方便私有部署、检查模型和定制推理,但它不是“小型本地模型”。320B MoE 即使每个 Token 只激活 18B,仍需存放或卸载完整权重,还要容纳 KV Cache、视觉模块与运行时开销。18B active 描述的是单步计算,不是下载大小和总内存占用。

大多数开发者先用 API 测效果更合理。只有持续用量、数据位置、定制内核或研究需求足以覆盖大规模推理设施时,自部署才值得。

跑分应该怎样看

Z.AI 公布了多项代码、Agent 和视觉成绩,并称其在若干测试中接近更大的闭源模型。这些数字可以参考,但属于厂商报告,结果会受到测试框架、工具配置、上下文管理和采样参数影响。

更实用的评估方法,是从自己的工作中挑几项:修一个真实仓库 Bug 并运行测试;从截图识别真正的失败状态;修改小型界面后核对渲染结果;从长文档中回答问题并引用原文;重复同一个多步骤任务观察稳定性。

同时记录总耗时、Token、人工修正和最终验收结果。若每次任务都要重做三遍,再低的 Token 单价也未必便宜。

以后还要叫 Ox Alpha 吗

讨论匿名测试、社区发现过程或那一周形成的搜索词时,可以继续使用 Ox Alpha。当前 API 接入、部署、价格和模型卡则应该使用 GLM-5.3-Flash

这不是文字洁癖。绑定临时 stealth/ox-alpha 路由的代码可能失效,也可能保留预览期假设。新项目应使用 Z.AI 文档中的 glm-5.3-flash,或所选平台当前的正式模型名。

匿名免费接口更适合公开或合成数据。若预览期间传过敏感材料,应回看当时适用的条款和日志;需要明确数据处理方与合同约束的生产任务,不该默认交给匿名端点。

与 Yix 图片工具的关系

GLM-5.3-Flash 可以在编程和推理流程中看图,但它不是 Yix 的图片生成模型。要创作图片,可以查看 Yix AI 模型目录;要把参考图转成可复用的生成提示词,可以使用免费的图片转提示词工具

区别很直接:GLM-5.3-Flash 回答关于图片的问题,Yix 的创作工具负责帮助你生成下一张图片。

结论

Ox Alpha 的身份之谜已经结束:它是 Z.AI 在正式发布前匿名测试的早期 GLM-5.3-Flash。

正式模型的卖点很清晰:原生多模态、100 万上下文、低价 API、MIT 开放权重,以及面向编程和长周期 Agent 的设计。代价也同样清楚:320B 总规模让自部署成为严肃的基础设施决定,官方跑分仍需用自己的任务复核。

现在应该评估的是 glm-5.3-flash,而不是“免费神秘模型”的传说。身份揭晓后,它少了神秘感,却更容易被负责任地采用。

相关阅读

想比较另一种托管版与开放权重的产品划分,可以继续看 Qwen3.8 Flash 与 Flash-Next 指南;想评估偏向图片理解与 OCR 的高速多模态接口,可以阅读 DeepSeek V4 Flash Vision Exp 指南

资料来源:Z.AI 发布文官方 API 指南官方价格页官方模型卡Bloomberg/Yahoo Finance 报道

Ox Alpha 与 GLM 名称属于各自权利人,Yix 与 Z.AI、OpenRouter 或 OpenCode 无关联。