Dieses Modell auswählen
Auswahlhinweise von Y-API. Die vorgeschlagenen Prüfungen sind keine bereits gemessenen Testergebnisse.
Geeignete erste Aufgaben
Erwäge es für Agenten-Fan-out, bei dem mehrere Instanzen dieselbe Art von Schritt parallel ausführen, oder für Codierhilfe, die einen ganzen Repository-Kontext in einer Anfrage lesen muss.
Worauf du achten solltest
Google hat dieses Modell am 2026-10-08 zurückgezogen: Anfragen werden automatisch auf 3.6 Flash geleitet, und der Preis ist von der Preisliste verschwunden. Die breite Modalitätsliste beschreibt das Modell, nicht das, was das Gateway weiterleitet, und was antwortet, ist nicht mehr dieses Modell; jedes Medienformat braucht eine eigene Prüfung. Die Flash-Stufe ist zudem keine Latenzmessung.
Modellspezifikationen
Dies sind Modellspezifikationen von OpenRouter, kein Y-API-Kompatibilitätstest. Einzelne Routen können weniger Formate, Parameter oder Tokens akzeptieren. Prüfe benötigte Funktionen mit kleinen Anfragen: Erfolgreicher Text belegt weder Bildverständnis noch Werkzeugaufrufe.
- Kontextfenster
- 1.048.576 tokens
- Eingabe
- Text · Bild · Video · Datei · Audio
- Ausgabe
- Text
- Bei OpenRouter gelistet seit
- Bei OpenRouter aufgeführte Parameter
include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p
Kosten berechnen
- Geschätzter Guthabenverbrauch
- 8,00 $
- Geschätztes Zahlungsäquivalent
- 0,80 $
Beispielhaftes Tokenbudget, keine Messung oder verbindliches Angebot. Enthält Ein- und Ausgabe, aber keine gesonderten Medienkosten, Cache-Rabatte oder Wiederholungen. Berechnete Reasoning-Tokens gehören zum Ausgabebudget. Die tatsächliche Abrechnung folgt der vom Dienst gemeldeten Nutzung.
$1 Zahlung ergibt $10 Guthaben. Zahlungsäquivalent = verbrauchtes Guthaben ÷ 10; dies ist nicht der Listenpreis des Modellentwicklers.
| Modell | Geschätzter Guthabenverbrauch | Geschätztes Zahlungsäquivalent |
|---|---|---|
| Gemini 3.5 Flash | 8,00 $ | 0,80 $ |
| Gemini 3.7 Flash | 5,25 $ | 0,525 $ |
| Gemini 3.1 Pro Preview | 9,50 $ | 0,95 $ |
API verwenden
Minimale Textanfragen mit der genauen Y-API-Modell-ID. Sie testen keine Bild-, Audio-, Video-, Datei- oder Werkzeugunterstützung. Plane auch Ausgabe für Reasoning ein; leerer Inhalt mit finish_reason=length kann auf ein ausgeschöpftes Budget hinweisen.
Eine Aufgabe zum Ausprobieren
Zerlege diese Funktionsanforderung in unabhängige Arbeitsstränge, die parallel umgesetzt werden könnten, und benenne die gemeinsamen Dateien, die Konflikte erzeugen würden.
Setze TOKEN auf einen Schlüssel aus der Konsole und führe das Beispiel lokal oder serverseitig aus. Schlüssel gehören weder in Browsercode noch in öffentliche Repositories.
curl --fail-with-body --silent --show-error --max-time 120 \
'https://api.y-api.bestvirtualgoods.com/v1/chat/completions' \
-H "Authorization: Bearer ${TOKEN:?Set TOKEN first}" \
-H 'Content-Type: application/json' \
--data-binary @- <<'JSON'
{
"model": "google/gemini-3.5-flash",
"messages": [
{
"role": "user",
"content": "Zerlege diese Funktionsanforderung in unabhängige Arbeitsstränge, die parallel umgesetzt werden könnten, und benenne die gemeinsamen Dateien, die Konflikte erzeugen würden."
}
],
"max_tokens": 4096
}
JSONErgebnis prüfen
Die Aufteilung muss wirklich unabhängig sein — prüfe, ob zwei Stränge dieselbe Datei berühren. Führe die Stränge dann parallel aus und zähle die tatsächlich auftretenden Merge-Konflikte.
Fragen zur Auswahl
Soll ich 3.5 Flash oder die neueren 3.7 und 3.8 Flash nutzen?
Nimm 3.8 Flash. Google hat 3.5 Flash am 2026-10-08 zurückgezogen und leitet seine Anfragen nun auf 3.6 Flash — der Modellname wählt also nicht mehr, was läuft. Behalte ihn nur, wenn du Ergebnisse an diese Generation gebunden hast und das Routing prüfst.
Quellen und Geltungsbereich
Technische Angaben stammen aus der genannten Modellseite und gegebenenfalls der verlinkten Entwicklerkarte. Eine Karte beschreibt einen Checkpoint, beweist aber nicht die vom Gateway verwendeten Gewichte. Preise stammen ausschließlich aus dem Y-API-Katalog. Für diesen Endpunkt werden keine gemessene Latenz, Verfügbarkeit oder Benchmarkwerte behauptet.