Kostenrechner für LLM-APIs
Wähl ein Modell, trag die Ein- und Ausgabe-Token ein, die du im Monat durchschiebst, und diese Seite rechnet aus, was dieser Monat an 5 Stellen gleichzeitig kostet. Ausgabe-Token werden zum Ausgabetarif abgerechnet, nicht zum Eingabetarif — bei einer Chat-Last ist dieser Unterschied ein Mehrfaches der Rechnung wert. Jede Zeile zeigt die verwendeten Einzelpreise, damit du die Multiplikation prüfen kannst, statt sie zu glauben.
Was dieser Monat kostet
USD / 1M Token
| Wo du aufrufst | Pro Monat | Einzelpreis |
|---|---|---|
| Y-APIDu bist hier | Pro Monat$0.105 | Einzelpreis$0.0075 Eingabe · $0.015 Ausgabe pro 1M |
| OpenRouterdeepseek/deepseek-v4-flash-0731 | Pro Monat$0.843datierter Snapshot-Build, nicht das rollierende Modell | Einzelpreis$0.06 Eingabe · $0.12 Ausgabe pro 1M |
| DeepInfradeepseek-ai/DeepSeek-V4-Flash | Pro Monat$1.264Standardstufe; Priority- und Flex-Stufen weichen ab | Einzelpreis$0.09 Eingabe · $0.18 Ausgabe pro 1M |
| Together AIDeepSeek V4 Flash 0731 | Pro Monat$1.963datierter Snapshot-Build, nicht das rollierende Modell | Einzelpreis$0.14 Eingabe · $0.28 Ausgabe pro 1M |
| DeepSeekAm teuerstendeepseek-v4-flash | Pro Monat$3.521,2Off-Peak-Satz; eine günstigere Cache-Treffer-Stufe existiert ebenfalls | Einzelpreis$0.22 Eingabe · $0.66 Ausgabe pro 1M |
Die teuerste der bepreisten Zeilen kostet $3.52 — 33.5× dieser Rechnung.
Bepreist an 4 der 4 Stellen, die wir für dieses Modell prüfen. Zeilen ohne Zahl nennen, welcher der beiden Gründe zutrifft.
Der Aufladekurs 20:1 ist zeitlich begrenzt. Beim regulären Kurs von 1:10 kostet derselbe Monat hier $0.21. Guthaben, das schon auf deinem Konto liegt, wird nicht neu bepreist.
- 1Off-Peak-Satz
- 2eine günstigere Cache-Treffer-Stufe existiert ebenfalls
- 3datierter Snapshot-Build, nicht das rollierende Modell
- 4Standardstufe; Priority- und Flex-Stufen weichen ab
Methode
Wie diese Rechnung entsteht
- Eingabe und Ausgabe getrennt bepreist
- Ausgabe-Token kosten bei jedem Anbieter in dieser Tabelle das Zwei- bis Vierfache von Eingabe-Token. Ein Rechner, der alle Token zum Eingabetarif abrechnet, setzt eine Chat-Last deutlich zu niedrig an — deshalb werden hier beide Werte abgefragt und beide Tarife angewendet.
- Unsere Zahl ist Bargeld, nicht Guthaben
- Unsere Tarife sind in USD-Guthaben ausgewiesen, und aus $1 Aufladung werden derzeit $20 Guthaben. Unsere Zeile teilt durch 20 und kommt so auf die Dollar, die tatsächlich von deiner Karte abgehen — die einzige Einheit, in der die anderen Zeilen stehen.
- Deren günstigste veröffentlichte Stufe
- Wenn ein Anbieter mehrere Tarife veröffentlicht, wird hier der günstigste genommen, der für einen gewöhnlichen Echtzeitaufruf gilt: Nebenzeit statt Hauptzeit, Standard statt Priorität, günstigste Region, kürzeste Eingabelängenstufe, nach allen zeitlich begrenzten Rabatten. Gecachte Eingabe ist überall ausgenommen, auch bei uns. Jede dieser Entscheidungen ist unter der Tabelle vermerkt, und jede einzelne begünstigt den anderen Anbieter.
- Nichts ist geschätzt
- Eine Zeile hat entweder einen Preis, der von der Preisseite des Anbieters selbst abgelesen wurde, oder sie sagt es. Keine Mittelwerte, kein „etwa“, keine Zahlen aus Beiträgen Dritter — allein für ein DeepSeek-Modell nennen drei viel zitierte Beiträge drei miteinander unvereinbare Preise.
Grenzen
Was in dieser Zahl nicht enthalten ist
Prompt-Caching
Hersteller-APIs rechnen gecachte Eingabe weit unter ihrem Cache-Miss-Tarif ab, und wir haben keine entsprechende Stufe. Wenn du einen langen, stabilen System-Prompt tausendfach wiederholst, kann der Hersteller günstiger sein als wir — dieser Rechner zeigt das nicht, weil er jedes Token auf beiden Seiten als Cache-Miss bepreist.
Reasoning-Token
Bei Reasoning-Modellen stecken Token, die abgerechnet werden, aber nie in der Antwort auftauchen, nicht in deiner Ausgabezahl. Ein von uns gemessenes Modell rechnete das 21,8-Fache seiner Ausgabegrenze ab. Wenn du ein Reasoning-Modell aufrufst, behandle die eingetragene Ausgabezahl als Untergrenze.
Alles, was keine Token sind
Kein Anbieter in dieser Tabelle erhebt eine Monatsgebühr, die Rechnung besteht also nur aus Token. Das heißt aber auch: Diese Rechnung sagt nichts über Rate Limits, Latenz oder darüber, welche Modelle ein Anbieter überhaupt hat — und genau das entscheidet die Wahl meistens.
FAQ
Fragen zu dieser Rechnung
- Warum muss ich Eingabe- und Ausgabe-Token getrennt eintragen?
- Weil sie überall unterschiedlich bepreist sind, meist um den Faktor zwei bis vier. Ein einziges Feld für „Token insgesamt“ würde eine Annahme über dein Verhältnis von Eingabe zu Ausgabe erzwingen, und für alle, deren Last diesem Verhältnis nicht entspricht, wäre die Rechnung etwa um diesen Faktor falsch. Das Standardszenario beim Laden ist 5:1 und liegt nahe an einer typischen Chat- oder RAG-Last — dein eigenes Protokoll nennt dir dein tatsächliches Verhältnis.
- Warum ist die Rechnung bei Y-API so viel niedriger?
- Fast vollständig wegen des Aufladekurses. Liest man unsere Guthabenpreise wie Dollar, liegen sie etwa auf den Listenpreisen der Hersteller selbst; die Lücke, die du siehst, ist der Kurs 20:1, zu dem ein Dollar zu Guthaben wird. Dieser Kurs ist zeitlich begrenzt und geht auf 1:10 zurück, was unsere Zahl verdoppelt — die Zeile unter der Tabelle zeigt, was dieser Monat dann kostet.
- Warum sind manche Zeilen leer?
- Aus zwei verschiedenen Gründen, und die Tabelle führt sie nie zusammen. Der eine sagt, dass der Anbieter dieses Modell überhaupt nicht führt. Der andere heißt, dass wir auf seiner eigenen Preisseite keinen Preis geprüft haben — nicht, dass das Modell nicht verfügbar ist, und nicht, dass es günstig ist. Beides aus einer Sekundärquelle aufzufüllen würde die Summe vollständig aussehen lassen und sie gleichzeitig falsch machen.
- Wie aktuell sind diese Preise?
- Jede externe Zahl wurde auf der Preisseite des jeweiligen Anbieters selbst abgelesen; die älteste dieser Ablesungen ist vom 2026-08-26 — das ist das Datum oben auf der Seite. Unsere eigenen Tarife kommen beim Build aus dem Live-Katalog und sind damit nie älter als das letzte Deployment. Anbieter ändern Preise tatsächlich ohne Ankündigung: Wenn eine Entscheidung davon abhängt, öffne den Quellenlink und prüf es.
Herkunft
Woher die Preise kommen
Jede externe Zahl in diesem Rechner kommt aus demselben Datensatz wie der vollständige Marktvergleich, der pro Anbieter einen Quellenlink samt Ablesedatum nennt.
Rechne es mit einer echten Anfrage nach
Am schnellsten prüfst du das alles mit einem einzigen Aufruf. Melde dich an, schick eine Anfrage, und das Nutzungsprotokoll zeigt die exakten Token-Zahlen und den exakten Abzug — dieselbe Multiplikation, die diese Seite gerade gemacht hat.