
LLM-API-Kosten: Batch-API, Prompt-Caching und Monatsprognose
Senken Sie Ihre OpenAI-/Anthropic-/Gemini-Rechnung: Input/Output schätzen, Batch und Caching in der Kalkulation aktivieren — geprüfte Tarife, 100 % lokal.
Von der Token-Zahl zur monatlichen API-Rechnung
Input- und Output-Tokens werden zu unterschiedlichen Preisen pro Million abgerechnet. Tokens zählen liefert Volumen; es sagt nicht, ob Batch-API, Prompt-Caching oder die Aufruffrequenz die Rechnung dominieren. Dieser Leitfaden setzt dort an, wo der Token-Zähl-Leitfaden endet: Zählungen in USD-Hebel übersetzen. Auf FastMinify wendet der LLM-Preisrechner eine datierte llm-models.json-Tabelle im Browser an — ein Planer, keine Rechnungsautorität. Ergänzen Sie mit dem LLM-Token-Zähler, wenn Sie noch Exact- oder Estimate-Zählungen brauchen. Der KI- & LLM-Tools-Hub bündelt den Rest des Clusters.
Häufige Fehler: Planer-Mathe mit der Rechnung vermischen
Batch-Rabatte unterscheiden sich nach Vendor, Modell und Job-Auflagen. Der FastMinify-Schalter ist ein flacher v1-Platzhalter, um die Form der Ersparnis zu sehen — kein Angebot.
Merken — Lesen Sie das Prüfdatum auf dem Preisrechner, bestätigen Sie die Batch-Eignung und den Prozentsatz in der Anbieter-Doku, bevor Sie die Finanzplanung briefen.
Cache-Ersparnis gilt nur für die Scheibe, die den Cache wirklich trifft. Tippen Sie 80 % cached bei einem einzigartigen User-Prompt, wirkt die Schätzung billig — Produktion nicht.
Merken — Starten Sie bei 0 gecachten Tokens und erhöhen Sie nur für ein dokumentiertes stabiles Präfix (System-Prompt, Tools, gepinnter Kontext).
×30 nimmt an, jeder Tag gleicht dem heutigen. Kontorabatte, fehlgeschlagene Retries und Regionalpreise gehen nie in diese Formel ein.
Merken — Nutzen Sie Pro Monat (30 Tage), um Optionen zu vergleichen; stimmen Sie die Ausgaben im Anbieter-Dashboard ab. Das Tool trifft die Rechnung nicht auf den Cent.
Eine Wortzahl oder der Tokenizer eines anderen Modells verzerrt USD. Claude- und Gemini-Zählungen auf FastMinify sind Estimate (±5–15 %), nicht anbieteroffiziell.
Merken — Zählen Sie zuerst am Zielmodell im LLM-Token-Zähler, übertragen Sie dann Input/Output in den Preisrechner.
Ehrliche Grenzen und der Umgang mit den Zahlen
Tarife liegen in einer manuell gepflegten llm-models.json, mindestens monatlich geprüft. Das Prüfdatum am Tool spiegelt diese Prüfung.
Der Rechner ist ein indikativer Planer für Chat-/Completion-ähnliche Tokenrechnungen.
Alle Mathematik und optionale Tokenableitung laufen im Browser. FastMinify ruft keine Anbieter-Preis-APIs auf und lädt keine Prompts hoch.
Vier USD-Hebel: Input, Output, Batch und Cache
Anbieter veröffentlichen Listenpreise als $ je 1M Input-Tokens und $ je 1M Output-Tokens. FastMinify rechnet lokal (Tokens / 1.000.000) × $/1M für das gewählte Modell. Completions sind pro Token oft mehrfach teurer als Prompts — eine kurze Frage mit langer Antwort kann mehr kosten als ein großer RAG-Paste mit einem Absatz. Output-Tokens werden in v1 nicht automatisch abgeleitet: setzen Sie sie aus Logs oder nach erwarteter Generierung.
Batch-Endpunkte tauschen Latenz gegen einen niedrigeren Tokenpreis. Der Batch-API-Schalter des Rechners wendet einen flachen 50-%-Rabatt auf die Zwischensumme an (Input- + Output-USD vor Rabatt). Das ist ein vereinfachtes v1-Modell — kein Live-Scrape der Batch-Tarife von OpenAI, Anthropic oder Google und keine Eignungsfenster. Bestätigen Sie den echten Tarif und die Eignung Ihrer Last, bevor Sie ein Budget festziehen.
Wiederholte Aufrufe mit stabilem Präfix (System-Prompt, Tool-Definitionen, festes RAG-Korpus) können einen Prompt-Cache treffen. FastMinify berechnet die gecachte Input-Scheibe mit 10 % des Input-Tarifs (90 % Ersparnis nur auf diesem Anteil). Sie geben ein, wie viele Input-Tokens voraussichtlich aus dem Cache bedient werden — das Tool simuliert keine Trefferlogik, TTLs oder Mindestpräfixe des Anbieters.
Wenn Aufrufe pro Tag größer als null ist, setzt der Rechner Tages-USD = Gesamt pro Aufruf × Aufrufe/Tag, dann Pro Monat (30 Tage) = täglich × 30. Das ist eine gerade 30-Tage-Extrapolation: keine Wochenenden, keine Saisonalität, keine Lastspitzen. Nutzen Sie sie zum Vergleich von Modellen oder Hebeln, stimmen Sie danach mit dem Anbieter-Dashboard ab.
Workflow: Token-Zähler → Preisrechner → Monatslinie
Öffnen Sie den LLM-Token-Zähler. Fügen Sie den Prompt oder das Messages-JSON ein, das Sie senden. Wählen Sie dasselbe Modell wie beim API-Aufruf. Kopieren Sie die Input-Summe (Exact- oder Estimate-Badge).
Öffnen Sie den LLM-Preisrechner. Geben Sie Input- und Output-Tokenzahlen ein (oder fügen Sie ein, um Input abzuleiten). Setzen Sie erwartete Output-Tokens manuell. Schalten Sie Batch-API, gecachte Input-Tokens und Aufrufe pro Tag. Das Prüfdatum auf der Seite ist die letzte Tabellenprüfung — nicht Ihr Rechnungsdatum.
Sie fahren eine 200k-Input- / 2k-Output-Zusammenfassung 50-mal pro Tag. Die Hälfte des Inputs ist ein stabiles System- plus Korpus-Präfix, das Sie cachen wollen. Interaktiver Chat kann nicht auf ein Batch-Fenster warten.
Baseline des interaktiven Aufrufs
200k Input, 2k Output, 0 cached, Batch aus, 50 Aufrufe/Tag. Gesamt pro Aufruf und Pro Monat (30 Tage) ablesen.
Cache auf dem stabilen Präfix addieren
Gecachten Input auf die Präfixgröße setzen, die Sie wirklich wiederverwenden (nicht 100 % des Pastes). In der Aufschlüsselung Gecachte Eingabe-Tokens beobachten — günstiger als Frische Eingabe-Tokens; Output bleibt gleich. Batch −50 % gilt danach auf die ganze Zwischensumme, einschließlich dieser bereits reduzierten Scheibe.
Nachtjob auf Batch umstellen
Für den nicht-interaktiven Lauf Batch-API aktivieren und Pro Monat (30 Tage) vergleichen. Batch für den latenzsensitiven Chat auslassen — der −50-%-Schalter ist ein Planer, keine Latenzgarantie.
Fazit
Eine nützliche Kostenschätzung trennt Input von Output und testet dann Batch-API- und Prompt-Cache-Hebel an Zählungen vom Zielmodell. Der FastMinify-Preisrechner macht das lokal mit datierter Tariftabelle, flachem −50-%-Batch-Platzhalter, gecachtem Input zu 10 % des Input-Tarifs und einer ×30-Monatslinie. Er trifft die Rechnung nicht auf den Cent — das ist Absicht: hier planen, im Anbieter-Dashboard abstimmen. Zählen Sie zuerst Tokens, wenn Sie noch Volumen brauchen; dann bepreisen Sie die Hebel.
Verwandte Artikel

RAG, Multi-Turn-Agenten, System-Prompts: Kontextfenster-Auslastung und verbleibende Reserve vor dem API-Aufruf berechnen.

Ehrlicher Leitfaden: einheitliche Tabellendaten, Workflow konvertieren → zählen → preisen → Kontext; kein JSON/YAML-Ersatz-Manifest.

Vor dem LLM-API-Aufruf: Tokens zählen, USD-Kosten schätzen und Kontextfenster prüfen — 100 % im Browser, ohne Ihren Prompt zu senden.