Yix
Voltar aos guias

Qwen3.8 2.4T A95B (batch): custo da API ou execução local?

Compare os preços da API Qwen3.8 2.4T A95B (lote) com inferência quantizada local, incluindo tamanho do modelo, contexto, memória, taxa de transferência e verificações de licença.

Última atualização: 29 de ago. de 2026Yix TeamYix Team
Qwen3.8 2.4T A95B (batch): custo da API ou execução local?

Qwen3.8 2.4T A95B (lote) descreve uma opção de carga de trabalho cara, mas capaz: enviar grandes trabalhos assíncronos para um endpoint hospedado ou operar você mesmo uma versão altamente quantizada do modelo de trilhões de parâmetros 2.4 do Qwen. O modelo é leve, mas seu tamanho torna o “local” um projeto de infraestrutura sério, em vez de uma conveniência para laptop.

A maioria das equipes deveria começar com uma API. A auto-hospedagem Qwen3.8 2.4T A95B torna-se razoável quando a colocação de dados, o volume sustentado, a inferência personalizada ou o acesso à pesquisa podem justificar centenas de gigabytes de pesos e uma pilha de serviços especializada.

O que Qwen3.8 2.4T A95B realmente é

O cartão de modelo oficial lista 2.4 trilhões de parâmetros totais e 95 bilhões de parâmetros ativados. É um modelo esparso de mistura de especialistas com especialistas 512, dos quais especialistas roteados 10 e um especialista compartilhado estão ativos por token. A rede possui camadas 92 e foi treinada com previsão de vários tokens.

Seu comprimento de contexto nativo é de tokens 262,144 e pode ser estendido para tokens 1,010,000. O ponto de verificação aberto é somente texto e sempre usa o modo de pensamento. A entrada multimodal e a operação sem pensamento não são suportadas nesta versão.

Esse último ponto evita um erro comum de nomenclatura. Qwen diz que o serviço hospedado Qwen3.8-Max é baseado neste ponto de verificação, mas adiciona recursos como entrada visual, suporte sem pensamento, ferramentas oficiais e um contexto 1M por padrão. Um resultado de Qwen3.8-Max não é automaticamente uma evidência para o ponto de verificação Qwen3.8 2.4T A95B aberto e vice-versa.

O que “lote” significa em uma decisão de compra

Uma carga de trabalho em lote geralmente significa que as solicitações podem esperar em uma fila e não precisam de uma resposta interativa. O processamento de documentos, a avaliação de repositórios, a classificação offline e a geração de relatórios noturnos se enquadram nesse padrão. O aplicativo envia o trabalho, registra uma ID e recupera os resultados posteriormente.

O rótulo não cria um ponto de verificação de modelo diferente. Pode descrever o modo de processamento de um fornecedor ou uma entrada no catálogo de preços. Confirme o endpoint, a janela de conclusão, as regras de cancelamento e o desconto com o provedor que você realmente usará.

Um Qwen3.8 2.4T A95B (lote) rastreador de preço atual lista $2 por milhão de tokens de entrada, $6 por milhão de tokens de saída e $0.25 por milhão de tokens de entrada em cache, atualizado Agosto 28, 2026. A [listagem OpenRouter] padrão (https://openrouter.ai/qwen/qwen3.8-2.4t-a95b?view=api) também mostra o modelo em vários provedores. Como os preços podem mudar rapidamente, trate o rastreador como uma fonte de descoberta e confirme a tarifa final do fornecedor selecionado antes de comprometer um orçamento.

Um exemplo de custo em lote

Suponha que uma tarefa de análise de código off-line envie tokens de entrada 200,000 e retorne tokens de saída 20,000. Nas taxas rastreadas, novos custos de entrada $0.40 e produção custam $0.12, por cerca de $0.52 por trabalho antes das taxas de plataforma ou outros encargos.

Dez mil empregos nesse formato custariam aproximadamente $5,200. Se um prefixo repetido se qualificar para entrada em cache, o total poderá cair. Se o agente reenviar repetidamente a alteração do contexto do repositório, talvez não. Meça os tokens novos e armazenados em cache separadamente.

A economia do lote depende da aceitação e também do preço do token. Se a porcentagem 20 das saídas precisar de uma segunda execução, inclua essa taxa de novas tentativas. Adicione armazenamento, orquestração, validação e tempo de revisão. Um preço de tabela mais baixo não ajuda se o fluxo de trabalho produzir silenciosamente respostas inutilizáveis.

Por que Qwen3.8 2.4T A95B local é difícil

"95B ativo" descreve o cálculo por token. Isso não significa que apenas 95 bilhões de parâmetros devam ser armazenados. O ponto de verificação 2.4T completo ainda precisa residir na memória do acelerador, na memória do sistema ou no armazenamento e se mover pelo sistema servidor.

Com dois bytes por parâmetro BF16, os pesos sozinhos são aproximadamente 4.8 terabytes por aritmética. Sobrecarga de tempo de execução, cache KV, buffers temporários, simultaneidade e um contexto longo acrescentam mais. A orientação oficial de serviço aponta para as versões atuais do SGLang, vLLM e TokenSpeed ​​para cargas de trabalho de produção.

A quantização agressiva altera os requisitos de armazenamento, mas também altera o comportamento. Unsloth relata um pacote dinâmico de bits 1 em torno de 397 GB. Um experimento LocalLLaMA usou essa quantização com um RTX 5090, um RTX 5060 Ti, 128 GB de RAM e 350 GB de swap.

O autor mediu cerca de tokens de saída 0.803 por segundo em um teste controlado de token 32 com decodificação especulativa. Sem essa configuração, o mesmo teste curto mediu cerca de tokens 0.775 por segundo. Esta é uma prova impressionante de que o modelo pode ser executado em hardware de consumo misto, mas não é um rendimento de produção interativo. O autor adverte explicitamente que prompts mais longos, comprimento do contexto, padrões de saída e roteamento especializado podem alterar o resultado.

API e inferência local lado a lado

API de lote hospedado e comparação de inferência quantizada local

Pergunta

API de lote hospedado

Inferência quantizada local

Primeiro resultadoGeralmente horas ou dias de integração

Hardware e trabalho de serviço vêm em primeiro lugar

Custo de capitalLow

High memória, armazenamento, GPUs e energia

Custo unitárioBaseado em token e fácil de observarDepende da utilização e operações
Localização dos dadosRegido pelos termos do provedorSob os controles de sua infraestrutura
Controle de modeloLimitado a configurações expostas

Quantização, kernels, roteamento e serviço

EscalonamentoProvedor lida com capacidadeSua equipe lida com capacidade e falhas
Reprodutibilidade

O endpoint pode mudar, a menos que seja versionado

Você pode fixar pesos e tempo de execução
Risco de desempenhoEspecífico do provedor

Específico de hardware, quantização e ajuste

Para uma avaliação inicial da qualidade, a rota hospedada vence porque isola o comportamento do modelo do trabalho de infraestrutura. Um teste local pode responder a uma pergunta diferente: se a quantização escolhida no seu hardware é precisa e rápida o suficiente.

Construa a avaliação antes do cluster

Use um conjunto fixo de trabalhos representativos. Inclui contexto de código longo, recuperação de documentos, uso de ferramentas e tarefas que exigem a conclusão do modelo, em vez de apenas sugerir um plano. Pontue a aceitação final, latência, uso de token e tempo de correção humana.

Para inferência local, registre o arquivo de peso exato, quantização, confirmação de tempo de execução, comprimento do contexto, tamanho do lote, simultaneidade, configurações de amostragem e hardware. Sem esses detalhes, “Qwen3.8 foi executado a X tokens por segundo” é quase sem sentido.

Para um teste em lote hospedado, registre o tempo de fila separadamente do tempo de computação. Verifique se os trabalhos com falha são cobrados, se um lote pode ser cancelado, como os resultados são retidos e se as solicitações permanecem dentro da região exigida. Execute um pequeno lote antes de enviar um corpus completo.

A licença precisa de uma revisão real

Qwen3.8 2.4T A95B usa a Licença Qwen3.8-Max, não MIT ou Apache 2.0. A licença concede amplos direitos para usar, modificar, hospedar, ajustar e criar derivados, sujeitos a condições.

Entre essas condições, certos produtos muito grandes devem exibir o nome do modelo, e um negócio de modelo como serviço ou assistente de trabalho de IA acima do limite de receita declarado precisa de uma licença comercial separada do Qwen. Leia o texto atual para obter as definições e limites exatos. Esta página não é aconselhamento jurídico.

O licenciamento é diferente para as duas rotas. Um provedor hospedado pode lidar com os pesos, enquanto seus próprios termos de serviço regem o uso da API. Uma implantação auto-hospedada atribui a responsabilidade pela licença modelo, pelos derivados e pelo comportamento downstream do produto diretamente à sua equipe.

Qual rota você deve escolher?

Escolha a rota hospedada Qwen3.8 2.4T A95B (lote) quando os trabalhos puderem esperar, a demanda for irregular e você quiser testar a capacidade sem possuir inferência. É também a escolha prática quando a carga de trabalho é grande, mas não o suficiente para manter ocupado hardware caro.

Considere a inferência local quando você tiver um requisito rígido de localização de dados, uma carga de trabalho constante, engenheiros que já operam serviços de modelos grandes ou uma necessidade de pesquisa que a API hospedada não consegue atender. Comece com o menor contexto e simultaneidade que atendem à carga de trabalho. O contexto máximo é uma opção de capacidade, não uma configuração padrão.

Onde se encaixa com Yix

Qwen3.8 2.4T A95B é um modelo de geração de texto, não um gerador de imagem atualmente disponível no Yix. Para criação de imagem, navegue no diretório do modelo de imagem Yix. Para transformar uma imagem de referência em um prompt de geração editável, use o Gerador de imagem para prompt gratuito.

A decisão para Qwen3.8 2.4T A95B (lote) se resume à utilização e controle. Defina o preço de um lote real, meça sua taxa de aceitação e compare isso com o custo total de armazenamento, serviço, monitoramento e revisão de uma implantação local quantizada.

Qwen relacionado e guias de modelo de codificação

Compare o ponto de verificação principal com o menor Qwen3.8 Flash e guia Flash-Next. Para obter uma rota do modelo de codificação em que os termos de uso de dados orientam a decisão, leia o Meta: guia Muse Spark 1.2 Contributor.

Fontes: placa modelo oficial Qwen3.8 2.4T A95B, Licença Qwen3.8-Max, lista de modelos OpenRouter, preços de lote rastreador e o experimento de inferência local da comunidade.

Qwen é uma marca registrada de seu respectivo proprietário. Yix não é afiliado a Qwen, OpenRouter, CostPerPrompt ou Unsloth.