Calculadora de custo de API de LLM
Escolha um modelo, informe os tokens de entrada e de saída que você passa em um mês, e esta página calcula quanto esse mês custa em 5 lugares ao mesmo tempo. Tokens de saída são cobrados pela tarifa de saída, não pela de entrada — numa carga de conversa essa diferença vale várias vezes a fatura. Cada linha mostra os preços unitários que usou, então você confere a multiplicação em vez de acreditar nela.
Quanto esse mês custa
USD / 1M tokens
| Onde você chama | Por mês | Preço unitário |
|---|---|---|
| Y-APIVocê está aqui | Por mês$0.105 | Preço unitário$0.0075 entrada · $0.015 saída por 1M |
| OpenRouterdeepseek/deepseek-v4-flash-0731 | Por mês$0.843build com data fixa, não o modelo que rola atualização | Preço unitário$0.06 entrada · $0.12 saída por 1M |
| DeepInfradeepseek-ai/DeepSeek-V4-Flash | Por mês$1.264faixa padrão; as faixas priority e flex diferem | Preço unitário$0.09 entrada · $0.18 saída por 1M |
| Together AIDeepSeek V4 Flash 0731 | Por mês$1.963build com data fixa, não o modelo que rola atualização | Preço unitário$0.14 entrada · $0.28 saída por 1M |
| DeepSeekMais carodeepseek-v4-flash | Por mês$3.521,2tarifa de horário reduzido; existe também uma faixa de cache-hit mais barata | Preço unitário$0.22 entrada · $0.66 saída por 1M |
A mais cara das linhas com preço custa $3.52 — 33.5× esta fatura.
Com preço em 4 dos 4 lugares que consultamos para este modelo. As linhas sem número dizem qual dos dois motivos se aplica.
A tarifa de recarga 20:1 é por tempo limitado. Na tarifa normal de 1:10, o mesmo mês custa $0.21 aqui. O crédito que já está na sua conta não é recalculado.
- 1tarifa de horário reduzido
- 2existe também uma faixa de cache-hit mais barata
- 3build com data fixa, não o modelo que rola atualização
- 4faixa padrão; as faixas priority e flex diferem
Método
Como esta fatura é calculada
- Entrada e saída tarifadas separadamente
- Tokens de saída custam de duas a quatro vezes os de entrada em todos os fornecedores desta tabela. Uma calculadora que cobra todos os tokens pela tarifa de entrada subestima uma carga de conversa por uma margem larga, então aqui as duas contagens são pedidas e as duas tarifas são aplicadas.
- Nosso número é dinheiro, não crédito
- Nossas tarifas são cotadas em crédito USD, e hoje uma recarga de $1 vira $20 de crédito. Nossa linha divide por 20 para chegar aos dólares que realmente saem do seu cartão, que é a única unidade em que as outras linhas estão.
- A faixa publicada mais barata deles
- Quando um fornecedor publica várias tarifas, aqui se pega a mais barata que valha para uma chamada comum em tempo real: fora de pico em vez de pico, padrão em vez de prioritário, a região mais barata, a faixa de comprimento de entrada mais curta, e depois de qualquer desconto por tempo limitado. Entrada em cache fica de fora em todos os casos, inclusive no nosso. Cada uma dessas escolhas está marcada abaixo da tabela e todas favorecem o outro fornecedor.
- Nada é estimado
- Uma linha ou tem um preço lido na própria página de preços daquele fornecedor, ou diz que não tem. Sem médias, sem "aproximadamente", sem números de textos de terceiros — só para um modelo da DeepSeek, três textos muito citados dão três preços incompatíveis entre si.
Limites
O que este número não inclui
Cache de prompt
As APIs dos fornecedores cobram entrada em cache muito abaixo da tarifa sem acerto de cache, e nós não temos faixa equivalente. Se você repete milhares de vezes um prompt de sistema longo e estável, o fornecedor pode sair mais barato que nós — esta calculadora não vai mostrar isso, porque tarifa cada token como falha de cache dos dois lados.
Tokens de raciocínio
Em modelos de raciocínio, tokens que são cobrados mas nunca aparecem na resposta não estão na sua contagem de saída. Um modelo que sondamos cobrou 21,8× o teto de saída. Se você chama um modelo de raciocínio, trate o número de saída que informar como um piso.
Tudo o que não é token
Nenhum fornecedor desta tabela cobra mensalidade, então a fatura é só tokens. Isso também quer dizer que a aritmética aqui não fala nada sobre limites de taxa, latência ou quais modelos um fornecedor realmente tem — e é isso que costuma decidir a escolha.
Perguntas frequentes
Perguntas sobre este cálculo
- Por que preciso informar tokens de entrada e de saída separadamente?
- Porque em todo lugar eles têm preços diferentes, normalmente por um fator de dois a quatro. Um único campo de "tokens totais" obrigaria a supor a sua proporção entre entrada e saída, e a fatura ficaria errada aproximadamente por esse fator para quem tem carga fora dessa proporção. O cenário padrão mostrado ao abrir é 5:1, perto de uma carga típica de chat ou RAG — o seu próprio log dirá a sua proporção real.
- Por que a fatura da Y-API é tão mais baixa?
- Quase tudo é a tarifa de recarga. Leia nossos preços de crédito como se fossem dólares e eles ficam mais ou menos sobre os preços de tabela dos próprios fornecedores; a diferença que você vê é a tarifa 20:1 pela qual um dólar se torna crédito. Essa tarifa é por tempo limitado e volta para 1:10, o que dobra o nosso número — a linha abaixo da tabela mostra quanto esse mês custaria então.
- Por que algumas linhas estão vazias?
- Por dois motivos diferentes, e a tabela nunca os junta. Um diz que o fornecedor não tem aquele modelo. O outro significa que não verificamos um preço na página de preços dele — não que o modelo esteja indisponível, e não que seja barato. Preencher qualquer um dos dois com fonte secundária deixaria o total com cara de completo e ao mesmo tempo errado.
- Quão atuais são esses preços?
- Cada número externo foi lido na própria página de preços daquele fornecedor; a mais antiga dessas leituras é de 2026-08-26, que é a data mostrada no topo. Nossas próprias tarifas vêm do catálogo ao vivo na compilação, então nunca são mais antigas que o último deploy. Os fornecedores mudam preços sem aviso, então para uma decisão que importa, abra o link da fonte e confira.
Procedência
De onde vêm os preços
Todo número externo desta calculadora vem do mesmo conjunto de dados da comparação completa de mercado, que lista um link de fonte por fornecedor junto com a data em que foi lido.
Confira a aritmética com uma requisição real
O jeito mais rápido de verificar tudo isso é uma chamada. Entre, envie uma requisição, e o log de uso mostra as contagens exatas de tokens e o desconto exato — que é a mesma multiplicação que esta página acabou de fazer.