Ox Alpha 身份揭晓:它就是 GLM-5.3-Flash
Ox Alpha 已不再神秘。Z.AI 确认这个 OpenRouter 隐身模型是 GLM-5.3-Flash 的早期版本,本文梳理时间线、价格、100 万上下文与开源权重。

Ox Alpha 已经不是匿名模型。Z.AI 在 2026 年 8 月 26 日确认,OpenRouter 和 OpenCode 上的这个隐身模型,是 GLM-5.3-Flash 的早期版本。
这条更新改变了此前所有评测的阅读方式。免费、匿名和社区“猜模型”属于发布故事;现在真正值得评估的产品已经有正式名称、API 文档、价格、可下载权重和许可证。
一句话概括:Ox Alpha 是公开压力测试,GLM-5.3-Flash 才是正式版本。
Ox Alpha 时间线
8 月 20 日,stealth/ox-alpha 出现在 OpenRouter。页面给出的卖点包括约 100 万 Token 上下文、超长输出、视觉输入,以及编程和长时间 Agent 任务。预览期免费,但开发者身份没有公开。
开发者很快开始测试代码能力、比较 tokenizer 特征并推测模型家族。那些分析提供了线索,却不能当成证明:匿名接口可能随时更换路由和配置,直接问模型“你是谁”也经常得到错误答案。
六天后,Z.AI 给出结论。GLM-5.3-Flash 官方发布文说明,公司在正式上线前,以 Ox Alpha 名义在 OpenCode 和 OpenRouter 做匿名测试并收集反馈。Bloomberg 经 Yahoo Finance 发布的报道也记录了 Z.AI 的确认。
预览版与正式版仍要分开看。Ox Alpha 是早期构建和临时服务配置,那一周的测试能说明真实流量下的表现,却不能代表长期价格、SLA 或最终模型的精确能力。
GLM-5.3-Flash 是什么
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型。官方模型卡显示,它有 320B 总参数,每个 Token 激活 18B 参数。
Z.AI 称它从新的基础模型开始训练,使用 30 万亿 Token 多模态语料,架构结合稀疏注意力与线性注意力,并引入 Manifold-Constrained Hyper-Connections。简单理解:它保留很大的总容量,但每次只激活一部分,并试图降低长上下文的推理成本。
官方 API 支持 100 万 Token 上下文。图片通过 image_url 内容块传入,可使用公网 URL 或 base64,也能在一条消息中放多张图。视觉能力被放进编程与 Agent 循环中,让模型查看界面或渲染结果,再继续修改。
它是推理与理解模型,输出文字,不是图片或视频生成器。
揭晓后的价格
Ox Alpha 免费周只是预览活动,并非永久定价。Z.AI 官方价格页列出的 GLM-5.3-Flash 价格为:
| Token 类型 | 每百万 Token 原价 | 活动价 |
|---|---|---|
| 输入 | $0.15 | $0.075 |
| 缓存输入 | $0.03 | $0.015 |
| 输出 | $0.50 | $0.25 |
五折活动计划于 2026 年 9 月 9 日 24:00(UTC+8)结束。做长期预算时应使用原价;如果从第三方平台调用,也应按该平台当前路由和条款计算,而不是默认等同于 Z.AI 直连接口。
GLM-5.3-Flash 的原价仍明显低于完整 GLM-5.3 的 $1.40 输入和 $4.40 输出。但低单价不等于低总成本:无效重试、长 Agent 循环、塞满上下文和冗长推理都可能放大账单。
开源权重与自部署
Z.AI 已在 Hugging Face 发布权重,许可证为 MIT,官方支持 SGLang、vLLM 和 KTransformers 等部署方式。
开放权重方便私有部署、检查模型和定制推理,但它不是“小型本地模型”。320B MoE 即使每个 Token 只激活 18B,仍需存放或卸载完整权重,还要容纳 KV Cache、视觉模块与运行时开销。18B active 描述的是单步计算,不是下载大小和总内存占用。
大多数开发者先用 API 测效果更合理。只有持续用量、数据位置、定制内核或研究需求足以覆盖大规模推理设施时,自部署才值得。
跑分应该怎样看
Z.AI 公布了多项代码、Agent 和视觉成绩,并称其在若干测试中接近更大的闭源模型。这些数字可以参考,但属于厂商报告,结果会受到测试框架、工具配置、上下文管理和采样参数影响。
更实用的评估方法,是从自己的工作中挑几项:修一个真实仓库 Bug 并运行测试;从截图识别真正的失败状态;修改小型界面后核对渲染结果;从长文档中回答问题并引用原文;重复同一个多步骤任务观察稳定性。
同时记录总耗时、Token、人工修正和最终验收结果。若每次任务都要重做三遍,再低的 Token 单价也未必便宜。
以后还要叫 Ox Alpha 吗
讨论匿名测试、社区发现过程或那一周形成的搜索词时,可以继续使用 Ox Alpha。当前 API 接入、部署、价格和模型卡则应该使用 GLM-5.3-Flash。
这不是文字洁癖。绑定临时 stealth/ox-alpha 路由的代码可能失效,也可能保留预览期假设。新项目应使用 Z.AI 文档中的 glm-5.3-flash,或所选平台当前的正式模型名。
匿名免费接口更适合公开或合成数据。若预览期间传过敏感材料,应回看当时适用的条款和日志;需要明确数据处理方与合同约束的生产任务,不该默认交给匿名端点。
与 Yix 图片工具的关系
GLM-5.3-Flash 可以在编程和推理流程中看图,但它不是 Yix 的图片生成模型。要创作图片,可以查看 Yix AI 模型目录;要把参考图转成可复用的生成提示词,可以使用免费的图片转提示词工具。
区别很直接:GLM-5.3-Flash 回答关于图片的问题,Yix 的创作工具负责帮助你生成下一张图片。
结论
Ox Alpha 的身份之谜已经结束:它是 Z.AI 在正式发布前匿名测试的早期 GLM-5.3-Flash。
正式模型的卖点很清晰:原生多模态、100 万上下文、低价 API、MIT 开放权重,以及面向编程和长周期 Agent 的设计。代价也同样清楚:320B 总规模让自部署成为严肃的基础设施决定,官方跑分仍需用自己的任务复核。
现在应该评估的是 glm-5.3-flash,而不是“免费神秘模型”的传说。身份揭晓后,它少了神秘感,却更容易被负责任地采用。
相关阅读
想比较另一种托管版与开放权重的产品划分,可以继续看 Qwen3.8 Flash 与 Flash-Next 指南;想评估偏向图片理解与 OCR 的高速多模态接口,可以阅读 DeepSeek V4 Flash Vision Exp 指南。
资料来源:Z.AI 发布文、官方 API 指南、官方价格页、官方模型卡及 Bloomberg/Yahoo Finance 报道。
Ox Alpha 与 GLM 名称属于各自权利人,Yix 与 Z.AI、OpenRouter 或 OpenCode 无关联。