Qwen3.8 2.4T A95B (batch) : coût de l’API ou exécution locale ?
Comparez les tarifs de l'API Qwen3.8 2.4T A95B (batch) avec l'inférence quantifiée locale, y compris la taille du modèle, le contexte, la mémoire, le débit et les vérifications de licence.

Qwen3.8 2.4T A95B (batch) décrit un choix de charge de travail coûteux mais performant : envoyer des tâches asynchrones volumineuses à un point de terminaison hébergé ou exploiter vous-même une version fortement quantifiée du modèle de Qwen à 2 400 milliards de paramètres. Le modèle est ouvert, mais sa taille fait du « local » un projet d'infrastructure sérieux plutôt qu'un confort d'ordinateur portable.
La plupart des équipes devraient commencer avec une API. L'auto-hébergement Qwen3.8 2.4T A95B devient raisonnable lorsque le placement des données, un volume soutenu, une inférence personnalisée ou un accès à la recherche peuvent justifier des centaines de gigaoctets de pondérations et une pile de services spécialisée.
Qu'est-ce que Qwen3.8 2.4T A95B est réellement
La carte de modèle officielle répertorie 2 400 milliards de paramètres au total, dont 95 milliards activés. Il s'agit d'un modèle mixte d'experts avec des experts 512, parmi lesquels des experts routés 10 et un expert partagé sont actifs par jeton. Le réseau comporte des couches 92 et a été formé avec la prédiction multi-jetons.
Sa longueur de contexte natif est constituée de jetons 262,144 et peut être étendue aux jetons 1,010,000. Le point de contrôle ouvert est uniquement en texte et utilise toujours le mode réflexion. Les entrées multimodales et les opérations sans réflexion ne sont pas prises en charge dans cette version.
Ce dernier point évite une erreur de dénomination courante. Qwen indique que le service hébergé Qwen3.8-Max est basé sur ce point de contrôle mais ajoute des fonctionnalités telles que la saisie visuelle, le support sans réflexion, les outils officiels et un contexte 1M par défaut. Un résultat de Qwen3.8-Max ne constitue pas automatiquement une preuve du point de contrôle ouvert Qwen3.8 2.4T A95B, et vice versa.
Que signifie « lot » dans une décision d'achat ?
Une charge de travail par lots signifie généralement que les demandes peuvent attendre dans une file d'attente et ne nécessitent pas de réponse interactive. Le traitement des documents, l'évaluation du référentiel, la classification hors ligne et la génération de rapports nocturnes correspondent à ce modèle. L'application soumet le travail, enregistre un identifiant et récupère les résultats plus tard.
L'étiquette ne crée pas de point de contrôle de modèle différent. Il peut décrire le mode de traitement d'un fournisseur ou une entrée du catalogue tarifaire. Confirmez le point de terminaison, la fenêtre d'achèvement, les règles d'annulation et la remise auprès du fournisseur que vous utiliserez réellement.
Un outil de suivi des prix actuel Qwen3.8 2.4T A95B (lot) répertorie $2 par million de jetons d'entrée, $6 par million de jetons de sortie et $0.25 par million de jetons d'entrée mis en cache, mis à jour en août. 28, 2026. La [liste OpenRouter] standard (https://openrouter.ai/qwen/qwen3.8-2.4t-a95b?view=api) montre également le modèle chez plusieurs fournisseurs. Étant donné que les prix peuvent changer rapidement, considérez le tracker comme une source de découverte et confirmez le tarif final du fournisseur sélectionné avant d'engager un budget.
Un exemple de coût par lots
Supposons qu’une tâche d’analyse de code hors ligne envoie des jetons d’entrée 200,000 et renvoie des jetons de sortie 20,000. Aux tarifs suivis, les coûts d'entrée frais $0.40 et les coûts de sortie $0.12, pour environ $0.52 par tâche avant les frais de plate-forme ou autres frais.
Dix mille emplois dans cette forme coûteraient environ $5,200. Si un préfixe répété se qualifie pour une entrée mise en cache, le total peut diminuer. Si l'agent renvoie à plusieurs reprises le contexte du référentiel modifié, il se peut que ce ne soit pas le cas. Mesurez séparément les jetons frais et mis en cache.
L’économie des lots dépend de l’acceptation ainsi que du prix symbolique. Si le pourcentage 20 des sorties nécessite une deuxième exécution, incluez ce taux de nouvelle tentative. Ajoutez du temps de stockage, d’orchestration, de validation et de révision. Un prix catalogue inférieur n’aide pas si le flux de travail produit silencieusement des réponses inutilisables.
Pourquoi le local Qwen3.8 2.4T A95B est difficile
« 95B actif » décrit le calcul par jeton. Cela ne signifie pas que seuls 95 milliards de paramètres doivent être stockés. Le point de contrôle 2.4T complet doit toujours résider dans la mémoire de l'accélérateur, la mémoire système ou le stockage et se déplacer dans le système de desserte.
À deux octets par paramètre BF16, les poids seuls représentent environ 4.8 téraoctets par arithmétique. La surcharge d'exécution, le cache KV, les tampons temporaires, la concurrence et un contexte long en ajoutent davantage. Les directives officielles de diffusion indiquent les versions actuelles de SGLang, vLLM et TokenSpeed pour les charges de travail de production.
Une quantification agressive modifie les besoins de stockage, mais elle modifie également le comportement. Unsloth signale un package dynamique de bits 1 autour de 397 Go. Une expérience LocalLLaMA a utilisé cette quantification avec un RTX 5090, un RTX 5060 Ti, un 128 Go de RAM et un 350 Go de swap.
L'auteur a mesuré environ les jetons de sortie 0.803 par seconde dans un test contrôlé de jetons 32 avec décodage spéculatif. Sans ce paramètre, le même court test mesurait environ des jetons 0.775 par seconde. C'est une preuve impressionnante que le modèle peut fonctionner sur du matériel grand public mixte, mais il ne s'agit pas d'un débit de production interactif. L'auteur prévient explicitement que des invites plus longues, la longueur du contexte, les modèles de sortie et le routage expert peuvent modifier le résultat.
API et inférence locale côte à côte
Question | API par lots hébergée | Inférence quantifiée locale |
|---|---|---|
| Premier résultat | Généralement des heures ou des jours d'intégration | Le travail sur le matériel et les services passe en premier |
| Coût d'investissement | Low | Mémoire, stockage, GPU et alimentation High |
| Coût unitaire | Basé sur des jetons et facile à observer | Dépend de l'utilisation et des opérations |
| Emplacement des données | Régi par les conditions du fournisseur | Sous les contrôles de votre infrastructure |
| Contrôle du modèle | Limité aux paramètres exposés | Quantification, noyaux, routage et service |
| Mise à l'échelle | Le fournisseur gère la capacité | Votre équipe gère la capacité et les pannes |
| Reproductibilité | Le point de terminaison peut changer à moins d'être versionné | Vous pouvez épingler les poids et le temps d'exécution |
| Risque de performances | Spécifique au fournisseur | Spécifique au matériel, à la quantification et au réglage |
Pour une première évaluation de la qualité, l'itinéraire hébergé l'emporte car il isole le comportement du modèle du travail d'infrastructure. Un test local peut répondre à une question différente : si une quantification choisie sur votre matériel est suffisamment précise et rapide.
Construire l'évaluation avant le cluster
Utilisez un ensemble fixe de tâches représentatives. Incluez le contexte du code long, la récupération des documents, l'utilisation des outils et les tâches qui nécessitent que le modèle se termine plutôt que de simplement suggérer un plan. Notez l'acceptation finale, la latence, l'utilisation des jetons et le temps de correction humaine.
Pour l'inférence locale, enregistrez le fichier de poids exact, la quantification, la validation d'exécution, la longueur du contexte, la taille du lot, la simultanéité, les paramètres d'échantillonnage et le matériel. Sans ces détails, "Qwen3.8 fonctionnait à X jetons par seconde" n'a presque aucun sens.
Pour un test par lots hébergé, enregistrez le temps d'attente séparément du temps de calcul. Vérifiez si les tâches ayant échoué sont facturées, si un lot peut être annulé, comment les résultats sont conservés et si les demandes restent dans la région requise. Exécutez un petit lot avant de télécharger un corpus complet.
La licence a besoin d’une vraie révision
Qwen3.8 2.4T A95B utilise la licence Qwen3.8-Max, et non MIT ou Apache 2.0. La licence accorde des droits étendus pour utiliser, modifier, héberger, affiner et créer des dérivés, sous certaines conditions.
Parmi ces conditions, certains produits très volumineux doivent afficher le nom du modèle, et une entreprise Model-as-a-Service ou AI Work Assistant dépassant le seuil de revenus indiqué a besoin d'une licence commerciale distincte de Qwen. Lisez le texte actuel pour connaître les définitions et les seuils exacts. Cette page ne constitue pas un conseil juridique.
La licence importe différemment pour les deux itinéraires. Un fournisseur hébergé peut gérer les pondérations tandis que ses propres conditions de service régissent l'utilisation de votre API. Un déploiement auto-hébergé confie la responsabilité de la licence du modèle, des dérivés et du comportement du produit en aval directement à votre équipe.
Quel itinéraire choisir ?
Choisissez l'itinéraire hébergé Qwen3.8 2.4T A95B (par lots) lorsque les tâches peuvent attendre, que la demande est inégale et que vous souhaitez tester les capacités sans posséder d'inférence. C’est également le choix pratique lorsque la charge de travail est importante mais pas suffisamment importante pour occuper du matériel coûteux.
Envisagez l'inférence locale lorsque vous avez des exigences strictes en matière de localisation des données, une charge de travail constante, des ingénieurs qui exploitent déjà des services de grands modèles ou un besoin de recherche auquel l'API hébergée ne peut pas répondre. Commencez par le plus petit contexte et la plus petite concurrence qui servent la charge de travail. Le contexte maximum est une option de capacité et non un paramètre par défaut.
Où il correspond avec Yix
Qwen3.8 2.4T A95B est un modèle de génération de texte et non un générateur d'images actuellement disponible sur Yix. Pour la création d'images, parcourez le répertoire du modèle d'image Yix. Pour transformer une image de référence en une invite de génération modifiable, utilisez le Générateur d'image en invite gratuit .
La décision concernant Qwen3.8 2.4T A95B (lot) se résume à l'utilisation et au contrôle. Évaluez un lot réel, mesurez son taux d'acceptation et comparez-le au coût complet de stockage, de service, de surveillance et d'examen d'un déploiement local quantifié.
Guides associés Qwen et modèles de codage
Comparez le point de contrôle phare avec le plus petit Qwen3.8 Flash et guide Flash-Next. Pour un itinéraire de modèle de codage où les termes d'utilisation des données déterminent la décision, lisez le Meta : guide Muse Spark 1.2 Contributor.
Sources : carte modèle officielle Qwen3.8 2.4T A95B, licence Qwen3.8-Max, liste des modèles OpenRouter, suivi des prix par lots et l'expérience d'inférence locale communautaire.
Qwen est une marque commerciale de son propriétaire respectif. Yix n'est pas affilié à Qwen, OpenRouter, CostPerPrompt ou Unsloth.