Comparação de preços de API de LLM

O mesmo modelo de pesos abertos pode custar valores bem diferentes dependendo de onde você o chama. Abaixo, 10 modelos precificados em cinco lugares ao mesmo tempo, todos convertidos para a mesma unidade: dólares por 1M tokens, cache-miss, faixa padrão. Cada número vem da própria página de preços do provedor na data indicada, e as linhas em que somos a opção cara estão destacadas mais adiante.

Critério

Como estes números foram montados

Uma unidade para todos
Nossas tarifas são cotadas em créditos em dólar; uma recarga de $1 vira atualmente $20 em créditos. Os números da nossa coluna são créditos divididos por 20 — o dinheiro que efetivamente sai do seu cartão. Os números dos demais já são dinheiro.
Faixa publicada mais barata, cache-miss
Quando um provedor publica várias faixas, a tabela toma a mais barata aplicável a uma chamada normal: a tarifa de horário reduzido da DeepSeek em vez da de pico, a faixa padrão da DeepInfra em vez da flex. Entrada em cache fica de fora em toda a tabela, incluindo a nossa coluna.
Os IDs deles, não os nossos
Agregadores costumam listar um build com data fixa (`-0813`) em vez do modelo que rola atualização, ou renomeá-lo pelo número de parâmetros. Esses casos estão marcados na tabela; um build datado não garante o mesmo comportamento do modelo atual.
Dois tipos diferentes de vazio
Uma célula com "Não está no catálogo" significa que verificamos e o provedor não carrega aquele modelo. Uma célula em branco significa que não verificamos — não que ele esteja indisponível. Os dois nunca são mesclados.
Preço de entrada por 1M tokens de 10 modelos nas APIs oficiais dos fornecedores, em três agregadores e no Y-API
xiaomi/mimo-v2.5por 1M tokensY-API$0.007 Entrada$0.014 SaídaXiaomi MiMo$0.142existe também uma faixa de cache-hit mais barata Entrada$0.28 Saídamimo-v2.5OpenRouter$0.1193build com data fixa, não o modelo que rola atualização Entrada$0.238 Saídaxiaomi/mimo-v2.5-20260422Together AINão está no catálogoDeepInfraNão está no catálogo
deepseek/deepseek-v4-flashpor 1M tokensY-API$0.0075 Entrada$0.015 SaídaDeepSeek$0.221,2tarifa de horário reduzido; existe também uma faixa de cache-hit mais barata Entrada$0.66 Saídadeepseek-v4-flashOpenRouter$0.063build com data fixa, não o modelo que rola atualização Entrada$0.12 Saídadeepseek/deepseek-v4-flash-0731Together AI$0.143build com data fixa, não o modelo que rola atualização Entrada$0.28 SaídaDeepSeek V4 Flash 0731DeepInfra$0.095faixa padrão; as faixas priority e flex diferem Entrada$0.18 Saídadeepseek-ai/DeepSeek-V4-Flash
minimax/minimax-m2.7por 1M tokensY-API$0.015 Entrada$0.06 SaídaMiniMax$0.302existe também uma faixa de cache-hit mais barata Entrada$1.20 SaídaMiniMax-M2.7Together AI$0.30 Entrada$1.20 SaídaMiniMax M2.7DeepInfraNão está no catálogo
minimax/minimax-m2.5por 1M tokensY-API$0.015 Entrada$0.06 SaídaMiniMax$0.302existe também uma faixa de cache-hit mais barata Entrada$1.20 SaídaMiniMax-M2.5Together AINão está no catálogoDeepInfraNão está no catálogo
qwen/qwen3.7-pluspor 1M tokensY-API$0.0175 Entrada$0.065 SaídaAlibaba Cloud Model StudioPreço não publicadoTogether AI$0.32 Entrada$1.28 SaídaQwen3.7-PlusDeepInfraNão está no catálogo
deepseek/deepseek-v4-propor 1M tokensY-API$0.025 Entrada$0.05 SaídaDeepSeek$0.661,2tarifa de horário reduzido; existe também uma faixa de cache-hit mais barata Entrada$1.98 Saídadeepseek-v4-proOpenRouter$1.1223build com data fixa, não o modelo que rola atualização Entrada$3.366 Saídadeepseek/deepseek-v4-pro-0813Together AI$1.74 Entrada$3.48 SaídaDeepSeek V4 ProDeepInfra$1.305faixa padrão; as faixas priority e flex diferem Entrada$2.60 Saídadeepseek-ai/DeepSeek-V4-Pro
minimax/minimax-m2.7-highspeedpor 1M tokensY-API$0.03 Entrada$0.12 SaídaMiniMax$0.60 Entrada$2.40 SaídaMiniMax-M2.7-highspeedTogether AINão está no catálogoDeepInfraNão está no catálogo
minimax/minimax-m2.5-highspeedpor 1M tokensY-API$0.03 Entrada$0.12 SaídaMiniMax$0.60 Entrada$2.40 SaídaMiniMax-M2.5-highspeedTogether AINão está no catálogoDeepInfraNão está no catálogo
qwen/qwen3.7-maxpor 1M tokensY-API$0.075 Entrada$0.225 SaídaAlibaba Cloud Model StudioPreço não publicadoTogether AI$1.25 Entrada$3.75 SaídaQwen3.7-MaxDeepInfra$2.505faixa padrão; as faixas priority e flex diferem Entrada$7.50 SaídaQwen/Qwen3.7-Max
qwen/qwen3.8-maxpor 1M tokensY-API$0.10 Entrada$0.30 SaídaAlibaba Cloud Model StudioPreço não publicadoOpenRouter$2.00 Entrada$6.00 SaídaTogether AI$2.504listado sob outro nome Entrada$6.25 SaídaQwen3.8-2.4T-A95BDeepInfra$1.655faixa padrão; as faixas priority e flex diferem Entrada$4.951 SaídaQwen/Qwen3.8-Max
  • 1tarifa de horário reduzido
  • 2existe também uma faixa de cache-hit mais barata
  • 3build com data fixa, não o modelo que rola atualização
  • 4listado sob outro nome
  • 5faixa padrão; as faixas priority e flex diferem

Onde somos mais baratos

A diferença vem da taxa de recarga, não de tarifas rebaixadas

Leia nossas tarifas em créditos como se fossem dólares e elas ficam praticamente sobrepostas aos preços de tabela dos próprios fornecedores — idênticas para os quatro modelos MiniMax e para xiaomi/mimo-v2.5, um pouco acima do oficial em xiaomi/mimo-v2.5-pro, abaixo dele nos dois builds da DeepSeek. Praticamente toda a diferença é a taxa de recarga de 20:1. É também por isso que é honesto dizer que o múltiplo é temporário: em 1:10 ele cai pela metade.

Contra os preços oficiais dos fornecedores, dinheiro contra dinheiro, os modelos comparáveis ficam entre 20× e 29.3× mais baratos na entrada.

Onde custamos mais

Três casos em que você não deveria usar a gente

Cargas que acertam o cache de prompt o tempo todo

A DeepSeek cobra entrada em cache a $0.022 por 1M no horário reduzido e a Xiaomi a $0.0028 — abaixo da nossa tarifa em dinheiro para os mesmos modelos. Não temos faixa de cache-hit alguma. Se você repassa um prompt de sistema longo e estável milhares de vezes, chamar o fornecedor direto pode custar menos que chamar a gente.

Modelos fora do nosso catálogo

Nosso catálogo tem 21 IDs de modelos. GPT, Claude e Gemini não estão nele, nem a maior parte da cauda longa que um agregador carrega. Nenhuma comparação de preços ajuda se o modelo de que você precisa não está na lista.

Quando você precisa de um preço que não muda

O múltiplo desta tabela se apoia numa taxa de recarga promocional de 20:1, por tempo limitado. Créditos já na conta não são repriciados, mas novas recargas depois do fim da promoção convertem em 1:10, o que corta pela metade cada vantagem mostrada aqui. Os preços de tabela dos fornecedores também não são contratuais, mas mudam devagar e em público.

Lacunas

O que falta nesta tabela, e por quê

Nem todo modelo está aqui
11 dos nossos 21 modelos ficam de fora. Dois modelos Qwen não têm preço externo verificado de nenhum tipo, dois builds da DeepSeek não aparecem em nenhuma página de preços que conseguíssemos conferir, e um modelo não revela o fornecedor.
A Alibaba não publica preço do Qwen
As páginas públicas de modelos dela listam apenas capacidades; a cobrança por token fica atrás de um console específico por região. É por isso que a coluna oficial fica em branco em toda linha Qwen — um vazio é melhor do que um número copiado de um blog. As nossas próprias tarifas estão numa página pública e num endpoint legível por máquina.
Nenhum número de terceiros foi usado
Só para um modelo da DeepSeek, três posts amplamente citados trazem três preços mutuamente incompatíveis. Aqui, só a própria página de preços do provedor vale como fonte.
Os agregadores divergem em até 2×
Qwen3.7-Max custa $1.25 por 1M de entrada na Together AI e $2.50 na DeepInfra — mesmo modelo, mesma unidade, mesmo dia. Trate qualquer número isolado de um agregador como um ponto de dados, não como o preço de mercado.

FAQ

Perguntas que esta tabela levanta

Qual é a forma mais barata de chamar o DeepSeek V4 Pro?
Verificado em 2026-08-26, por 1M de tokens de entrada: Y-API a $0.025 em dinheiro, a própria API da DeepSeek a $0.66 no horário reduzido e $1.32 no pico, DeepInfra a $1.30, OpenRouter a $1.122 para o build datado 0813, Together AI a $1.74. O único caso que inverte é o prompt com cache constante — a DeepSeek cobra $0.022 por 1M para entrada em cache, um pouco abaixo da nossa tarifa.
Por que os preços do Y-API são cotados em créditos em vez de dólares?
O crédito é a unidade de medição dentro do serviço: a recarga converte dólares em crédito pela taxa atual, e cada modelo desconta crédito por token. Cotar em créditos mantém o número por modelo estável quando a taxa de recarga muda. Para obter o preço em dinheiro, divida a tarifa em créditos pela taxa atual — 20 hoje, 10 depois da promoção. Ambos os números são publicados, e o preço em dinheiro está no endpoint de preços legível por máquina.
Um agregador consegue ser mais barato que o próprio fornecedor do modelo?
Sim, e esta tabela tem um exemplo. O OpenRouter lista o build datado xiaomi/mimo-v2.5-20260422 a $0.119 por 1M de entrada, abaixo dos $0.14 da própria Xiaomi. Agregadores às vezes listam só um build com data fixa, que não acompanha o modelo que rola atualização conforme ele evolui — mais barato, mas não é a mesma coisa.
Quanto da diferença é desconto real e quanto é só a promoção de recarga?
Praticamente tudo é a promoção. Comparados como se crédito fosse dólar, os nossos preços igualam os preços de tabela dos fornecedores nos quatro modelos MiniMax e em xiaomi/mimo-v2.5, ficam 3% acima do oficial em xiaomi/mimo-v2.5-pro e abaixo dele nos dois builds da DeepSeek. Os múltiplos grandes da tabela vêm da taxa de recarga de 20:1, que é por tempo limitado e vai voltar para 1:10.
Com que frequência esta tabela é atualizada?
Cada número carrega a data em que foi verificado, exibida no topo da página. Provedores mudam preços sem aviso, então trate qualquer coisa com mais de algumas semanas como ponto de partida e siga o link da fonte antes de comprometer orçamento. As nossas próprias tarifas são sincronizadas do catálogo ativo na hora do build, então nunca ficam mais velhas que o último deploy.

Procedência

Fontes

Um link por provedor, cada um apontando para a página de onde os números foram lidos. As tarifas do próprio Y-API vêm das páginas de modelos e de preços, e de https://y-api.bestvirtualgoods.com/pricing.json.

Confira um modelo contra a sua própria fatura

Escolha o modelo que você mais chama, encontre-o na tabela e multipl pela contagem de tokens do mês passado. Se a conta fechar, entre e aponte uma chamada para cá — o log de requisições vai mostrar o desconto real.