Yix
Torna alle guide

Ox Alpha svelato: era GLM-5.3-Flash

Il Bue Alfa non è più un mistero. Z.AI ha rivelato il modello OpenRouter stealth come GLM-5.3-Flash. Visualizza la sequenza temporale, il contesto 1M, il prezzo API e i pesi aperti.

Ultimo aggiornamento: 27 ago 2026Yix TeamYix Team
Ox Alpha svelato: era GLM-5.3-Flash

Ox Alpha non è più un modello di intelligenza artificiale anonima. Z.AI ha rivelato in agosto 26, 2026 che il modello stealth testato su OpenRouter e OpenCode era una versione iniziale di GLM-5.3-Flash.

Questo aggiornamento cambia il modo in cui dovrebbe essere letta ogni precedente recensione di Ox Alpha. L'anteprima gratuita, il provider anonimo e il rilevamento delle impronte digitali della comunità appartengono alla storia del lancio. Il modello disponibile per una valutazione seria ora ha un nome ufficiale, documentazione, prezzo API, pesi scaricabili e una licenza.

Ecco la risposta breve: Ox Alpha è stato uno stress test pubblico. GLM-5.3-Flash è il prodotto rilasciato.

La sequenza temporale di Ox Alpha

Nel mese di agosto 20 è apparso un modello con l'ID stealth/ox-alpha. Il suo elenco prometteva una finestra di contesto di circa 1 milioni di token, output molto lungo, input visivo e un focus sulla codifica e sulle attività dell'agente a lunga esecuzione. L'accesso era gratuito durante l'anteprima stealth, mentre l'identità dello sviluppatore rimaneva nascosta.

La combinazione ha suscitato interesse immediato. Gli sviluppatori ne hanno testato il comportamento di codifica, hanno confrontato i modelli di tokenizzazione e hanno provato a identificare la famiglia del modello. Quel lavoro era indicativo, non una prova. Un endpoint anonimo può modificare il proprio routing o configurazione e le richieste di autoidentificazione sono notoriamente inaffidabili.

Sei giorni dopo, Z.AI ha risolto la questione. Il suo post di lancio GLM-5.3-Flash afferma che l'azienda ha testato il modello in modo anonimo come Ox Alpha su OpenCode e OpenRouter per raccogliere feedback prima del rilascio. Il rapporto di Bloomberg, ripubblicato da Yahoo Finance, riporta anche la conferma di Z.AI.

La distinzione tra anteprima e rilascio è ancora importante. Ox Alpha era una build iniziale e una configurazione di servizio temporanea. I risultati di quella settimana sono un'utile prova del comportamento nel traffico reale, ma non devono essere trattati come un prezzo permanente, una promessa di livello di servizio o una misurazione esatta del modello finale.

Cos'è GLM-5.3-Flash

GLM-5.3-Flash è il primo modello nativamente multimodale della famiglia GLM-5. La scheda modello ufficiale elenca 320 miliardi di parametri totali con 18 miliardi attivati ​​alla volta.

Z.AI afferma di aver addestrato un nuovo modello base su un corpus multimodale da 30 trilioni di token. L'architettura combina l'attenzione sparsa con l'attenzione lineare e aggiunge iperconnessioni vincolate al collettore. In parole povere, il modello ha una capacità totale elevata ma è progettato per utilizzare una sezione attiva più piccola e per ridurre il costo dell'elaborazione di lunghe sequenze.

L'API ufficiale supporta una finestra di contesto da milioni di token 1. L'input di immagini viene aggiunto come blocchi di contenuto image_url, con un URL esterno o un URL di dati base64. È possibile includere più immagini in un messaggio. Le capacità visive del modello sono destinate a vivere all'interno del suo ciclo di codifica e agente, in modo che possa ispezionare un'interfaccia o un output renderizzato e quindi rivedere il suo lavoro.

Questo è un modello di ragionamento e comprensione. Emette testo; non è un generatore di immagini o video.

Prezzo Ox Alpha dopo la rivelazione

La settimana gratuita di Ox Alpha era un'offerta di anteprima, non il prezzo commerciale permanente. La pagina dei prezzi Z.AI ufficiale elenca GLM-5.3-Flash all'indirizzo:

Tipo di tokenPrezzo di listino per 1MPrezzo promozionale per 1M
Ingresso$0.15$0.075
Ingresso memorizzato nella cache$0.03$0.015
Uscita$0.50$0.25

La promozione 50% terminerà alle ore 24:00 settembre 9, 2026, UTC+8. Il prezzo di listino è la base più sicura per un budget a lungo termine. Se un marketplace di terze parti offre una tariffa diversa, utilizza il prezzo e i termini per quella tratta anziché dare per scontato che si applichi il prezzo API diretto di Z.AI.

Al prezzo di listino, il modello è molto più economico dell'endpoint GLM-5.3 completo, che Z.AI elenca a $1.40 per milione di token di input e $4.40 per milione di token di output. Il costo è solo una parte della decisione: nuovi tentativi, cicli di agenti, contesti enormi e ragionamenti dettagliati possono ancora dominare il conto.

Pesi aperti e self-hosting

Z.AI ha pubblicato i pesi GLM-5.3-Flash su Hugging Face sotto la licenza MIT. Le opzioni di servizio ufficiali includono SGLang, vLLM e KTransformers.

I pesi aperti rendono possibili l'ispezione, la distribuzione privata e la personalizzazione dell'inferenza. Non ne fanno un piccolo modello locale. Un modello con una combinazione di parametri 320B deve comunque archiviare o scaricare i pesi completi, oltre alla cache KV, allo stack di visione e al sovraccarico di runtime. La cifra attiva 18B descrive il calcolo per token, non il download totale o l'impronta di memoria.

Per la maggior parte degli sviluppatori, l'API è il primo percorso di valutazione sensato. Il self-hosting diventa interessante quando l'utilizzo prolungato, la posizione dei dati, i kernel personalizzati o l'accesso alla ricerca giustificano una sostanziale configurazione di inferenza.

Cosa fanno e cosa non dimostrano i benchmark

Z.AI riporta ottimi risultati per codifica, attività degli agenti e visione, inclusi miglioramenti rispetto a GLM-5.2 e prestazioni vicino a modelli proprietari più grandi su test selezionati. Questi numeri sono utili, ma sono segnalati dal fornitore e dipendono da un cablaggio specifico, dalla configurazione dello strumento, dalla strategia del contesto e dalla configurazione di campionamento.

La domanda migliore è se GLM-5.3-Flash completa il tuo lavoro in modo affidabile. Costruisci una piccola valutazione partendo dalle attività che già comprendi:

  • correggere un bug del repository ed eseguire i test;
  • ispezionare uno screenshot e identificare lo stato effettivo di errore;
  • modificare una piccola interfaccia, quindi confrontare il risultato renderizzato con la richiesta;
  • rispondere a una domanda attraverso un lungo documento con prove citate;
  • ripetere un'attività dell'agente in più fasi per misurare la coerenza.

Registra il tempo totale, l'utilizzo del token, le correzioni e l'accettazione finale. Un modello economico per token può comunque essere costoso se richiede tre tentativi o introduce silenziosamente difetti.

Dovresti ancora usare il nome Ox Alpha?

Utilizza Ox Alpha quando parli del test stealth, della sua scoperta o delle query di ricerca create durante quella settimana. Utilizza GLM-5.3-Flash per l'integrazione API corrente, le schede modello, l'implementazione e i prezzi.

Questa scelta di denominazione è più che pulizia editoriale. Il codice creato rispetto a una route stealth/ox-alpha temporanea potrebbe smettere di funzionare o mantenere i presupposti di anteprima. Le nuove integrazioni dovrebbero utilizzare l'ID modello glm-5.3-flash documentato da Z.AI o l'attuale elenco denominato dal marketplace selezionato.

Se hai gestito dati sensibili o di produzione durante il periodo anonimo, rivedi i termini e i registri applicati in quel momento. Un'anteprima gratuita e senza attribuzione è adatta per dati di valutazione pubblici o sintetici; si tratta di un valore predefinito inadeguato per il materiale che richiede un processore noto e controlli contrattuali.

Dove si inserisce accanto agli strumenti di immagine

GLM-5.3-Flash può ispezionare le immagini come parte di un ciclo di codifica o ragionamento, ma non genera immagini su Yix. Per la creazione visiva, vedere la directory dei modelli AI Yix. Per trasformare un'immagine di riferimento in un prompt di generazione riutilizzabile, utilizza il Generatore di immagini per prompt gratuito.

La differenza è semplice: GLM-5.3-Flash risponde a domande sull'input visivo; Gli strumenti creativi di Yix aiutano a produrre l'immagine successiva.

In conclusione

Il mistero attorno a Ox Alpha è finito. Si trattava del primo GLM-5.3-Flash di Z.AI, testato in modo anonimo per meno di una settimana prima del rilascio ufficiale.

Il modello rilasciato ha una presentazione pratica credibile: input multimodale nativo, una finestra di contesto 1M, prezzi API bassi, pesi aperti secondo il MIT e un design mirato alla codifica e agli agenti a lungo orizzonte. Le sue enormi dimensioni totali rendono il self-hosting una decisione infrastrutturale seria e le sue affermazioni di riferimento necessitano ancora di convalida sulle tue attività.

Valuta glm-5.3-flash, non la leggenda di un endpoint stealth gratuito. La rivelazione ha reso il modello meno misterioso e molto più facile da valutare in modo responsabile.

Guide correlate al modello veloce

Per una diversa suddivisione del modello aperto rispetto a quello ospitato, confrontare Qwen3.8 Flash con Flash-Next. Per un'API multimodale veloce focalizzata sulla comprensione delle immagini e sull'OCR, leggi la guida DeepSeek V4 Flash Vision Exp.

Fonti: post sul lancio di Z.AI, guida API Z.AI, prezzi Z.AI, scheda modello ufficiale e Bloomberg tramite Yahoo Finance.

Ox Alpha e GLM sono nomi utilizzati dai rispettivi proprietari. Yix non è affiliato con Z.AI, OpenRouter o OpenCode.