Yix
Volver a las guías

Qwen3.8 2.4T A95B (batch): costes de API frente a ejecución local

Compare los precios de la API Qwen3.8 2.4T A95B (por lotes) con inferencia cuantificada local, incluido el tamaño del modelo, el contexto, la memoria, el rendimiento y las comprobaciones de licencia.

Última actualización: 29 ago 2026Yix TeamYix Team
Qwen3.8 2.4T A95B (batch): costes de API frente a ejecución local

Qwen3.8 2.4T A95B (batch) describe una opción de carga de trabajo costosa pero capaz: enviar grandes trabajos asincrónicos a un punto final alojado u operar usted mismo una versión altamente cuantificada del modelo de billones de parámetros 2.4 de Qwen. El modelo es liviano, pero su tamaño hace que "local" sea un proyecto de infraestructura serio en lugar de una comodidad para una computadora portátil.

La mayoría de los equipos deberían comenzar con una API. El autohospedaje Qwen3.8 2.4T A95B se vuelve razonable cuando la ubicación de los datos, el volumen sostenido, la inferencia personalizada o el acceso a la investigación pueden justificar cientos de gigabytes de pesos y una pila de servicios especializada.

Qué es realmente Qwen3.8 2.4T A95B

La tarjeta de modelo oficial enumera 2.4 billones de parámetros totales y 95 mil millones de parámetros activados. Es un modelo de mezcla escasa de expertos con expertos 512, de los cuales expertos enrutados 10 y un experto compartido están activos por token. La red tiene capas 92 y fue entrenada con predicción de múltiples tokens.

La longitud de su contexto nativo es de tokens 262,144 y se puede ampliar a tokens 1,010,000. El punto de control abierto es sólo de texto y siempre utiliza el modo de pensamiento. Esta versión no admite la entrada multimodal ni la operación sin pensamiento.

Este último punto evita un error común de denominación. Qwen dice que el servicio alojado Qwen3.8-Max se basa en este punto de control, pero agrega características como entrada visual, soporte sin pensar, herramientas oficiales y un contexto 1M de forma predeterminada. Un resultado de Qwen3.8-Max no es automáticamente evidencia del punto de control abierto Qwen3.8 2.4T A95B, y viceversa.

Qué significa "lote" en una decisión de compra

Una carga de trabajo por lotes normalmente significa que las solicitudes pueden esperar en una cola y no necesitan una respuesta interactiva. El procesamiento de documentos, la evaluación del repositorio, la clasificación fuera de línea y la generación de informes nocturnos se ajustan a ese patrón. La aplicación envía el trabajo, registra una identificación y recupera los resultados más tarde.

La etiqueta no crea un punto de control de modelo diferente. Puede describir el modo de procesamiento de un proveedor o una entrada del catálogo de precios. Confirme el punto final, la ventana de finalización, las reglas de cancelación y el descuento con el proveedor que realmente utilizará.

Un Qwen3.8 2.4T A95B (batch) price tracker enumera $2 por millón de tokens de entrada, $6 por millón de tokens de salida y $0.25 por millón de tokens de entrada almacenados en caché, actualizado en agosto 28, 2026. El [listado de OpenRouter] estándar (https://openrouter.ai/qwen/qwen3.8-2.4t-a95b?view=api) también muestra el modelo en varios proveedores. Dado que los precios pueden cambiar rápidamente, trate el rastreador como una fuente de descubrimiento y confirme la tarifa final del proveedor seleccionado antes de comprometer un presupuesto.

Un ejemplo de costo por lotes

Supongamos que un trabajo de análisis de código fuera de línea envía tokens de entrada 200,000 y devuelve tokens de salida 20,000. A las tarifas rastreadas, los insumos nuevos cuestan $0.40 y los costos de producción $0.12, aproximadamente $0.52 por trabajo antes de tarifas de plataforma u otros cargos.

Diez mil puestos de trabajo con esa forma costarían aproximadamente $5,200. Si un prefijo repetido califica para entrada almacenada en caché, el total puede disminuir. Si el agente reenvía repetidamente el contexto cambiante del repositorio, es posible que no lo haga. Mida los tokens nuevos y almacenados en caché por separado.

La economía de lotes depende tanto de la aceptación como del precio simbólico. Si el porcentaje 20 de las salidas necesita una segunda ejecución, incluya esa tasa de reintentos. Agregue almacenamiento, orquestación, validación y tiempo de revisión. Un precio de lista más bajo no ayuda si el flujo de trabajo produce silenciosamente respuestas inutilizables.

Por qué es difícil Qwen3.8 2.4T A95B local

"95B activo" describe el cálculo por token. Esto no significa que solo se deban almacenar 95 mil millones de parámetros. El punto de control 2.4T completo todavía tiene que vivir en la memoria del acelerador, la memoria del sistema o el almacenamiento y moverse a través del sistema de servicio.

A dos bytes por parámetro BF16, los pesos por sí solos son aproximadamente terabytes 4.8 por aritmética. La sobrecarga del tiempo de ejecución, la caché KV, los buffers temporales, la concurrencia y un contexto largo añaden más. La guía oficial de publicación apunta a las versiones actuales de SGLang, vLLM y TokenSpeed ​​para cargas de trabajo de producción.

La cuantificación agresiva cambia los requisitos de almacenamiento, pero también cambia el comportamiento. Unsloth informa de un paquete dinámico de bits 1 alrededor de 397 GB. Un experimento LocalLLaMA utilizó esa cuantificación con un RTX 5090, un RTX 5060 Ti, 128 GB de RAM y 350 GB de intercambio.

El autor midió alrededor de tokens de salida 0.803 por segundo en una prueba controlada del token 32 con decodificación especulativa. Sin esa configuración, la misma prueba corta midió alrededor de tokens 0.775 por segundo. Esta es una prueba impresionante de que el modelo puede ejecutarse en hardware de consumo mixto, pero no es un rendimiento de producción interactivo. El autor advierte explícitamente que las indicaciones más largas, la longitud del contexto, los patrones de salida y el enrutamiento experto pueden cambiar el resultado.

API e inferencia local lado a lado

API por lotes alojada y comparación de inferencia cuantificada local

Pregunta

API por lotes alojada

Inferencia cuantificada local

Primer resultadoGeneralmente horas o días de integración

El trabajo de hardware y servicio es lo primero

Costo de capitalLow

memoria, almacenamiento, GPU y energía High

Costo unitarioBasado en tokens y fácil de observar

Depende de la utilización y las operaciones

Ubicación de datosRegido por los términos del proveedorBajo los controles de su infraestructura
Control de modeloLimitado a configuraciones expuestas

Cuantización, núcleos, enrutamiento y servicio

EscaladoEl proveedor maneja la capacidad

Su equipo maneja la capacidad y las fallas

Reproducibilidad

El punto final puede cambiar a menos que se versione

Puedes fijar pesos y tiempo de ejecución
Riesgo de rendimientoEspecífico del proveedor

Hardware, cuantización y afinación específicos

Para una evaluación de calidad inicial, la ruta alojada gana porque aísla el comportamiento del modelo del trabajo de infraestructura. Una prueba local puede responder a una pregunta diferente: si una cuantificación elegida en su hardware es lo suficientemente precisa y rápida.

Construya la evaluación antes del clúster.

Utilice un conjunto fijo de trabajos representativos. Incluya contexto de código largo, recuperación de documentos, uso de herramientas y tareas que requieran que el modelo finalice en lugar de simplemente sugerir un plan. Califique la aceptación final, la latencia, el uso de tokens y el tiempo de corrección humana.

Para la inferencia local, registre el archivo de peso exacto, la cuantificación, la confirmación del tiempo de ejecución, la longitud del contexto, el tamaño del lote, la simultaneidad, la configuración de muestreo y el hardware. Sin esos detalles, "Qwen3.8 se ejecutó a X tokens por segundo" casi no tiene sentido.

Para una prueba por lotes alojada, registre el tiempo de cola por separado del tiempo de cálculo. Compruebe si se facturan los trabajos fallidos, si se puede cancelar un lote, cómo se retienen los resultados y si las solicitudes permanecen dentro de la región requerida. Ejecute un lote pequeño antes de cargar un corpus completo.

La licencia necesita una revisión real.

Qwen3.8 2.4T A95B utiliza la licencia Qwen3.8-Max, no MIT ni Apache 2.0. La licencia otorga amplios derechos para usar, modificar, alojar, ajustar y crear derivados, sujeto a condiciones.

Entre esas condiciones, ciertos productos muy grandes deben mostrar el nombre del modelo, y un negocio de Modelo como Servicio o Asistente de Trabajo de IA por encima del umbral de ingresos establecido necesita una licencia comercial separada de Qwen. Lea el texto actual para conocer las definiciones y los umbrales exactos. Esta página no es asesoramiento legal.

La concesión de licencias importa de manera diferente para las dos rutas. Un proveedor alojado puede manejar los pesos, mientras que sus propios términos de servicio rigen el uso de su API. Una implementación autohospedada asigna la responsabilidad de la licencia del modelo, los derivados y el comportamiento del producto posterior directamente a su equipo.

¿Qué ruta deberías elegir?

Elija la ruta alojada Qwen3.8 2.4T A95B (por lotes) cuando los trabajos puedan esperar, la demanda sea desigual y desee probar la capacidad sin poseer inferencias. También es la opción práctica cuando la carga de trabajo es grande pero no lo suficiente como para mantener ocupado el costoso hardware.

Considere la inferencia local cuando tenga un requisito de ubicación de datos concretos, una carga de trabajo constante, ingenieros que ya operan servicios de modelos grandes o una necesidad de investigación que la API alojada no puede satisfacer. Comience con el contexto y la simultaneidad más pequeños que atiendan la carga de trabajo. El contexto máximo es una opción de capacidad, no una configuración predeterminada.

Dónde encaja con Yix

Qwen3.8 2.4T A95B es un modelo de generación de texto, no un generador de imágenes disponible actualmente en Yix. Para crear imágenes, busque el directorio de modelos de imágenes Yix. Para convertir una imagen de referencia en un mensaje de generación editable, utilice el Generador de imágenes a mensajes gratuito .

La decisión sobre Qwen3.8 2.4T A95B (lote) se reduce a la utilización y el control. Fije el precio de un lote real, mida su tasa de aceptación y compárelo con el costo total de almacenar, servir, monitorear y revisar una implementación local cuantificada.

Guías relacionadas con Qwen y modelos de codificación

Compare el punto de control insignia con el más pequeño Qwen3.8 Flash y guía Flash-Next. Para conocer una ruta de modelo de codificación donde los términos de uso de datos impulsan la decisión, lea la Meta: guía Muse Spark 1.2 Contributor.

Fuentes: tarjeta de modelo oficial Qwen3.8 2.4T A95B, licencia Qwen3.8-Max, listado de modelos de OpenRouter, rastreador de precios por lotes, y el experimento comunitario de inferencia local.

Qwen es una marca comercial de su respectivo propietario. Yix no está afiliado a Qwen, OpenRouter, CostPerPrompt o Unsloth.