Qwen3.8 2.4T A95B (batch): costo dell’API o esecuzione locale?
Confronta i prezzi dell'API Qwen3.8 2.4T A95B (batch) con l'inferenza quantizzata locale, inclusi i controlli su dimensioni del modello, contesto, memoria, throughput e licenza.

Qwen3.8 2.4T A95B (batch) descrive una scelta di carico di lavoro costosa ma efficace: inviare lavori asincroni di grandi dimensioni a un endpoint ospitato o utilizzare personalmente una versione fortemente quantizzata del modello da 2.400 miliardi di parametri di Qwen. Il modello è open-weight, ma le sue dimensioni rendono "locale" un progetto infrastrutturale serio piuttosto che una comodità per un laptop.
La maggior parte dei team dovrebbe iniziare con un'API. Il self-hosting Qwen3.8 2.4T A95B diventa ragionevole quando il posizionamento dei dati, il volume sostenuto, l'inferenza personalizzata o l'accesso alla ricerca possono giustificare centinaia di gigabyte di pesi e uno stack di servizio specializzato.
Cos'è in realtà Qwen3.8 2.4T A95B
La scheda modello ufficiale elenca 2.400 miliardi di parametri totali e 95 miliardi di parametri attivati. Si tratta di un modello con una combinazione sparsa di esperti con esperti 512, di cui gli esperti instradati 10 e un esperto condiviso sono attivi per token. La rete ha livelli 92 ed è stata addestrata con la previsione multi-token.
La sua lunghezza del contesto nativo è di token 262,144 e può essere estesa ai token 1,010,000. Il checkpoint aperto è di solo testo e utilizza sempre la modalità di pensiero. L'input multimodale e le operazioni non pensanti non sono supportati in questa versione.
Quest'ultimo punto impedisce un errore di denominazione comune. Qwen afferma che il servizio Qwen3.8-Max ospitato si basa su questo checkpoint ma aggiunge funzionalità come input visivo, supporto non pensante, strumenti ufficiali e un contesto 1M per impostazione predefinita. Un risultato da Qwen3.8-Max non è automaticamente una prova per il checkpoint Qwen3.8 2.4T A95B aperto e viceversa.
Cosa significa "lotto" in una decisione di acquisto
Un carico di lavoro batch in genere significa che le richieste possono attendere in coda e non necessitano di una risposta interattiva. L'elaborazione dei documenti, la valutazione dell'archivio, la classificazione offline e la generazione di report notturni rientrano in questo schema. L'applicazione invia il lavoro, registra un ID e recupera i risultati in un secondo momento.
L'etichetta non crea un checkpoint del modello diverso. Può descrivere la modalità di elaborazione di un fornitore o una voce del catalogo dei prezzi. Conferma l'endpoint, la finestra di completamento, le regole di cancellazione e lo sconto con il fornitore che utilizzerai effettivamente.
Un servizio che monitora i prezzi di Qwen3.8 2.4T A95B (batch), aggiornato al 28 agosto 2026, riporta $2 per milione di token in ingresso, $6 per milione di token in uscita e $0.25 per milione di token in ingresso memorizzati nella cache. Anche la scheda su OpenRouter elenca il modello presso diversi fornitori. I prezzi possono cambiare rapidamente: usa il servizio come punto di partenza e verifica la tariffa finale del fornitore scelto prima di impegnare un budget.
Un esempio di costo batch
Supponiamo che un processo di analisi del codice offline invii token di input 200,000 e restituisca token di output 20,000. Alle tariffe tracciate, i costi di input freschi $0.40 e i costi di output $0.12, per circa $0.52 per lavoro prima delle tariffe della piattaforma o di altri addebiti.
Diecimila posti di lavoro di questo tipo costerebbero circa $5,200. Se un prefisso ripetuto si qualifica per l'input memorizzato nella cache, il totale potrebbe diminuire. Se l'agente invia nuovamente la modifica del contesto del repository, potrebbe non essere così. Misura i token freschi e quelli memorizzati nella cache separatamente.
L'economia del lotto dipende dall'accettazione e dal prezzo simbolico. Se la percentuale 20 degli output necessita di una seconda esecuzione, includere tale percentuale di tentativi. Aggiungi spazio di archiviazione, orchestrazione, convalida e tempo di revisione. Un prezzo di listino inferiore non aiuta se il flusso di lavoro produce silenziosamente risposte inutilizzabili.
Perché il locale Qwen3.8 2.4T A95B è difficile
"95B attivo" descrive il calcolo per token. Ciò non significa che devono essere memorizzati solo 95 miliardi di parametri. Il checkpoint 2.4T completo deve ancora vivere nella memoria dell'acceleratore, nella memoria di sistema o nell'archivio e spostarsi attraverso il sistema di servizio.
Con due byte per parametro BF16, i pesi da soli sono circa 4.8 terabyte in aritmetica. L'overhead di runtime, la cache KV, i buffer temporanei, la concorrenza e un contesto lungo aggiungono altro. Le linee guida ufficiali per la pubblicazione indicano le versioni attuali di SGLang, vLLM e TokenSpeed per i carichi di lavoro di produzione.
La quantizzazione aggressiva modifica i requisiti di archiviazione, ma cambia anche il comportamento. Unsloth segnala un pacchetto 1-bit dinamico attorno a 397 GB. Un esperimento LocalLLaMA ha utilizzato tale quantizzazione con un RTX 5090, un RTX 5060 Ti, 128 GB di RAM e 350 GB di swap.
L'autore ha misurato circa token di output 0.803 al secondo in un test controllato di token 32 con decodifica speculativa. Senza questa impostazione, lo stesso breve test ha misurato circa token 0.775 al secondo. Questa è una prova impressionante che il modello può essere eseguito su hardware consumer misto, ma non si tratta di un throughput di produzione interattivo. L'autore avverte esplicitamente che prompt più lunghi, lunghezza del contesto, modelli di output e routing esperto possono modificare il risultato.
API e inferenza locale fianco a fianco
Domanda | API batch ospitata | Inferenza quantizzata locale |
|---|---|---|
| Primo risultato | Di solito ore o giorni di integrazione | Il lavoro sull'hardware e sul servizio viene prima di tutto |
| Costo del capitale | Low | Memoria, spazio di archiviazione, GPU e potenza High |
| Costo unitario | Basato su token e facile da osservare | Dipende dall'utilizzo e dalle operazioni |
| Posizione dei dati | Regolato dai termini del fornitore | Sotto i controlli della tua infrastruttura |
| Controllo modello | Limitato alle impostazioni esposte | Quantizzazione, kernel, routing e servizio |
| Ridimensionamento | Il provider gestisce la capacità | Il tuo team gestisce capacità e guasti |
| Riproducibilità | L'endpoint può cambiare a meno che non venga modificata la versione | Puoi appuntare pesi e tempo di esecuzione |
Rischio relativo alle prestazioni | Specifico del provider | Specifico per hardware, quantizzazione e accordatura |
Per una valutazione iniziale della qualità, il percorso ospitato vince perché isola il comportamento del modello dal lavoro infrastrutturale. Un test locale può rispondere a una domanda diversa: se la quantizzazione scelta sul tuo hardware è sufficientemente accurata e veloce.
Costruisci la valutazione prima del cluster
Utilizzare un insieme fisso di lavori rappresentativi. Includere il contesto del codice lungo, il recupero dei documenti, l'uso degli strumenti e le attività che richiedono il completamento del modello anziché limitarsi a suggerire un piano. Punteggio dell'accettazione finale, della latenza, dell'utilizzo del token e del tempo di correzione umana.
Per l'inferenza locale, registrare il peso esatto del file, la quantizzazione, il commit di runtime, la lunghezza del contesto, la dimensione del batch, la concorrenza, le impostazioni di campionamento e l'hardware. Senza questi dettagli, "Qwen3.8 ha funzionato a X token al secondo" è quasi privo di significato.
Per un test batch ospitato, registrare il tempo in coda separatamente dal tempo di calcolo. Controlla se i lavori non riusciti vengono fatturati, se un batch può essere annullato, come vengono conservati i risultati e se le richieste rimangono all'interno della regione richiesta. Esegui un piccolo batch prima di caricare un corpus completo.
La licenza necessita di una vera revisione
Qwen3.8 2.4T A95B utilizza la licenza Qwen3.8-Max, non MIT o Apache 2.0. La licenza garantisce ampi diritti di utilizzo, modifica, hosting, messa a punto e creazione di derivati, soggetti a condizioni.
Tra queste condizioni, alcuni prodotti molto grandi devono mostrare il nome del modello e un'azienda Model-as-a-Service o AI Work Assistant al di sopra della soglia di fatturato dichiarata necessita di una licenza commerciale separata da Qwen. Leggere il testo attuale per le definizioni e le soglie esatte. Questa pagina non costituisce una consulenza legale.
La questione della licenza è diversa per le due rotte. Un provider ospitato può gestire i pesi mentre i propri termini di servizio regolano l'utilizzo dell'API. Una distribuzione self-hosted affida la responsabilità della licenza del modello, dei derivati e del comportamento del prodotto downstream direttamente al tuo team.
Quale percorso dovresti scegliere?
Scegli il percorso ospitato Qwen3.8 2.4T A95B (batch) quando i lavori possono attendere, la domanda non è uniforme e desideri testare la capacità senza possedere l'inferenza. È anche la scelta pratica quando il carico di lavoro è elevato ma non abbastanza grande da mantenere occupato hardware costoso.
Prendi in considerazione l'inferenza locale quando hai requisiti rigorosi di localizzazione dei dati, un carico di lavoro costante, ingegneri che già gestiscono modelli di grandi dimensioni o un'esigenza di ricerca che l'API ospitata non può soddisfare. Inizia con il contesto e la concorrenza più piccoli necessari al carico di lavoro. Il contesto massimo è un'opzione di capacità, non un'impostazione predefinita.
Dove si adatta a Yix
Qwen3.8 2.4T A95B è un modello di generazione di testo, non un generatore di immagini attualmente disponibile su Yix. Per la creazione di immagini, sfoglia la directory del modello immagine Yix. Per trasformare un'immagine di riferimento in un prompt di generazione modificabile, utilizza il Generatore di immagini da richiedere gratuito.
La decisione per Qwen3.8 2.4T A95B (lotto) dipende dall'utilizzo e dal controllo. Determina il prezzo di un batch reale, misura il suo tasso di accettazione e confrontalo con il costo completo di archiviazione, fornitura, monitoraggio e revisione di una distribuzione locale quantizzata.
Qwen correlato e guide ai modelli di codifica
Confronta il checkpoint di punta con il più piccolo Qwen3.8 Flash e guida Flash-Next. Per un percorso basato sul modello di codifica in cui i termini relativi all'utilizzo dei dati guidano la decisione, leggi la Meta: guida Muse Spark 1.2 Contributor.
Fonti: scheda modello ufficiale Qwen3.8 2.4T A95B, Licenza Qwen3.8-Max, elenco dei modelli OpenRouter, prezzi batch tracker e l'esperimento di inferenza locale della comunità.
Qwen è un marchio del rispettivo proprietario. Yix non è affiliato con Qwen, OpenRouter, CostPerPrompt o Unsloth.