LLM-API-Kosten: Batch-API, Prompt-Caching und Monatsprognose

LLM-API-Kosten: Batch-API, Prompt-Caching und Monatsprognose

Senken Sie Ihre OpenAI-/Anthropic-/Gemini-Rechnung: Input/Output schätzen, Batch und Caching in der Kalkulation aktivieren — geprüfte Tarife, 100 % lokal.

21.08.2026
10 Min. Lektüre
Teilen Sie diesen Artikel:
llm
pricing
batch-api
prompt-caching
openai
ai
Anleitung

Von der Token-Zahl zur monatlichen API-Rechnung

Input- und Output-Tokens werden zu unterschiedlichen Preisen pro Million abgerechnet. Tokens zählen liefert Volumen; es sagt nicht, ob Batch-API, Prompt-Caching oder die Aufruffrequenz die Rechnung dominieren. Dieser Leitfaden setzt dort an, wo der Token-Zähl-Leitfaden endet: Zählungen in USD-Hebel übersetzen. Auf FastMinify wendet der LLM-Preisrechner eine datierte llm-models.json-Tabelle im Browser an — ein Planer, keine Rechnungsautorität. Ergänzen Sie mit dem LLM-Token-Zähler, wenn Sie noch Exact- oder Estimate-Zählungen brauchen. Der KI- & LLM-Tools-Hub bündelt den Rest des Clusters.

Input- vs. Output-USD trennen: (Tokens / 1e6) × $/1M
Vereinfachten Batch-API-Rabatt von −50 % auf die Zwischensumme modellieren
Gecachte Input-Scheibe mit 10 % des Input-Tarifs bepreisen
30-Tage-Summe aus Aufrufen pro Tag projizieren
Kein Prompt-Upload zu OpenAI, Anthropic oder Google

Häufige Fehler: Planer-Mathe mit der Rechnung vermischen

−50 % Batch als Ihren Live-Anbietertarif behandeln

Batch-Rabatte unterscheiden sich nach Vendor, Modell und Job-Auflagen. Der FastMinify-Schalter ist ein flacher v1-Platzhalter, um die Form der Ersparnis zu sehen — kein Angebot.

MerkenLesen Sie das Prüfdatum auf dem Preisrechner, bestätigen Sie die Batch-Eignung und den Prozentsatz in der Anbieter-Doku, bevor Sie die Finanzplanung briefen.

Gecachte Tokens eintragen, die Sie nie gemessen haben

Cache-Ersparnis gilt nur für die Scheibe, die den Cache wirklich trifft. Tippen Sie 80 % cached bei einem einzigartigen User-Prompt, wirkt die Schätzung billig — Produktion nicht.

MerkenStarten Sie bei 0 gecachten Tokens und erhöhen Sie nur für ein dokumentiertes stabiles Präfix (System-Prompt, Tools, gepinnter Kontext).

Die Monatslinie als Rechnung lesen

×30 nimmt an, jeder Tag gleicht dem heutigen. Kontorabatte, fehlgeschlagene Retries und Regionalpreise gehen nie in diese Formel ein.

MerkenNutzen Sie Pro Monat (30 Tage), um Optionen zu vergleichen; stimmen Sie die Ausgaben im Anbieter-Dashboard ab. Das Tool trifft die Rechnung nicht auf den Cent.

Die falschen Tokenzahlen bepreisen

Eine Wortzahl oder der Tokenizer eines anderen Modells verzerrt USD. Claude- und Gemini-Zählungen auf FastMinify sind Estimate (±5–15 %), nicht anbieteroffiziell.

MerkenZählen Sie zuerst am Zielmodell im LLM-Token-Zähler, übertragen Sie dann Input/Output in den Preisrechner.

Ehrliche Grenzen und der Umgang mit den Zahlen

Datierte Tabelle, keine Live-Preis-API

Tarife liegen in einer manuell gepflegten llm-models.json, mindestens monatlich geprüft. Das Prüfdatum am Tool spiegelt diese Prüfung.

Listenpreise ändern sich auf Anbieterseiten ohne Vorankündigung — vor großen Ausgaben erneut prüfen
Kontorabatte, Credits und Regionalpreise sind out of scope
Streitfälle gehören ins Anbieter-Dashboard, nicht auf diese Seite
Eigene $/1M sind der Hypothesenweg bei Vertragstarifen
In v1 nur USD
Was v1 nicht modelliert

Der Rechner ist ein indikativer Planer für Chat-/Completion-ähnliche Tokenrechnungen.

Keine Embeddings-, Bild-, Audio- oder Tool-Call-Tokenregeln
Keine Simulation von Cache-TTL, Präfix-Pinning oder Anbieter-Hit-Rate
Batch −50 % ist nicht die veröffentlichte Batch-Matrix jedes Vendors
Estimate-Zählungen: ±5–15 % — nicht auf den letzten Dollar nur mit Estimate budgetieren
Output-Tokens bleiben manuell — das Paste-Feld rät keine Completions
Datenschutz

Alle Mathematik und optionale Tokenableitung laufen im Browser. FastMinify ruft keine Anbieter-Preis-APIs auf und lädt keine Prompts hoch.

Geeignet für proprietäre Prompts und interne Specs
Kein Konto nötig zum Schätzen
512-KiB-Paste-Limit — sehr große Exporte teilen
Provider-Usage-Tokens in Produktion als Quelle der Wahrheit instrumentieren
Hub-Workflow: Token-Zähler → Preisrechner → Kontextfenster-Rechner, wenn der Prompt auch überlaufen könnte

Vier USD-Hebel: Input, Output, Batch und Cache

Input vs. Output: zwei Zähler, zwei Tarife

Anbieter veröffentlichen Listenpreise als $ je 1M Input-Tokens und $ je 1M Output-Tokens. FastMinify rechnet lokal (Tokens / 1.000.000) × $/1M für das gewählte Modell. Completions sind pro Token oft mehrfach teurer als Prompts — eine kurze Frage mit langer Antwort kann mehr kosten als ein großer RAG-Paste mit einem Absatz. Output-Tokens werden in v1 nicht automatisch abgeleitet: setzen Sie sie aus Logs oder nach erwarteter Generierung.

Zwischensumme = frische Eingabe + gecachte Eingabe + Ausgabe; Batch −50 % gilt auf diese Zwischensumme
Prompt einfügen, um Input-Tokens über denselben countTokensAsync-Pfad wie der Zähler abzuleiten
Exact-Badge (OpenAI-Encodings) vs. Estimate (±5–15 %) für Claude und Gemini
Zahlenfelder nutzen, wenn Usage bereits aus Anbieter-Logs vorliegt
512 KiB UTF-8 max pro Paste bei FastMinify-KI-Tools
Batch-API: flaches −50 % als v1-Platzhalter

Batch-Endpunkte tauschen Latenz gegen einen niedrigeren Tokenpreis. Der Batch-API-Schalter des Rechners wendet einen flachen 50-%-Rabatt auf die Zwischensumme an (Input- + Output-USD vor Rabatt). Das ist ein vereinfachtes v1-Modell — kein Live-Scrape der Batch-Tarife von OpenAI, Anthropic oder Google und keine Eignungsfenster. Bestätigen Sie den echten Tarif und die Eignung Ihrer Last, bevor Sie ein Budget festziehen.

Batch an → Gesamt pro Aufruf = 50 % des Totals ohne Batch
Rabatt gilt nach Input/Output- (und Cache-)Mathe auf der Zwischensumme
Nacht-/Offline-Jobs sind typische Batch-Kandidaten; Chat-Oberflächen meist nicht
Eignung und tatsächliches % stehen auf der Anbieterseite — nicht in diesem Tool
Schalter aus, um interaktiv vs. Batch bei gleichen Tokenzahlen zu vergleichen
Prompt-Caching: 10 % des Input-Tarifs auf der Cache-Scheibe

Wiederholte Aufrufe mit stabilem Präfix (System-Prompt, Tool-Definitionen, festes RAG-Korpus) können einen Prompt-Cache treffen. FastMinify berechnet die gecachte Input-Scheibe mit 10 % des Input-Tarifs (90 % Ersparnis nur auf diesem Anteil). Sie geben ein, wie viele Input-Tokens voraussichtlich aus dem Cache bedient werden — das Tool simuliert keine Trefferlogik, TTLs oder Mindestpräfixe des Anbieters.

Kosten für Gecachte Eingabe-Tokens = 10 % des Input-$/1M; das Cache-Feld wird so begrenzt, dass es die Gesamteingabe nicht überschreitet
Verbleibender frischer Input zahlt den vollen Input-Tarif
Output-Tokens werden in diesem v1-Modell nie gecacht
Stabile System-Prompts cachen besser als einzigartige User-Turns
Das Feld ist eine Annahme — keine garantierte Trefferquote
Monatsprognose: Aufrufe pro Tag × 30

Wenn Aufrufe pro Tag größer als null ist, setzt der Rechner Tages-USD = Gesamt pro Aufruf × Aufrufe/Tag, dann Pro Monat (30 Tage) = täglich × 30. Das ist eine gerade 30-Tage-Extrapolation: keine Wochenenden, keine Saisonalität, keine Lastspitzen. Nutzen Sie sie zum Vergleich von Modellen oder Hebeln, stimmen Sie danach mit dem Anbieter-Dashboard ab.

Beispiel: 10 Aufrufe/Tag → Pro Monat (30 Tage) = Gesamt pro Aufruf × 300
Null Aufrufe/Tag → keine Monatslinie (Per-Call-Total bleibt sichtbar)
Alle Modelle vergleichen nutzt dieselben Zählungen und Optionen über die Registry
Eigene $/1M-Werte decken Vertrags- oder Hypothesentarife ab
In v1 nur USD — keine MwSt., Commitments oder Regionalwährung

Workflow: Token-Zähler → Preisrechner → Monatslinie

Schritt 1 — Ehrliche Input-Tokens holen

Öffnen Sie den LLM-Token-Zähler. Fügen Sie den Prompt oder das Messages-JSON ein, das Sie senden. Wählen Sie dasselbe Modell wie beim API-Aufruf. Kopieren Sie die Input-Summe (Exact- oder Estimate-Badge).

Derselbe countTokensAsync-Pfad wie das Paste-Feld des Preisrechners
Exact (OpenAI) vs. Estimate (Claude, Gemini) — Estimate nicht als Evangelium behandeln
API-Messages-Modus addiert ChatML-Overhead gegenüber Klartext
512 KiB max — übergroße RAG-Dumps teilen
Tokenizer-Details stehen im oben verlinkten Token-Zähl-Leitfaden
Schritt 2 — USD-Hebel im Preisrechner setzen

Öffnen Sie den LLM-Preisrechner. Geben Sie Input- und Output-Tokenzahlen ein (oder fügen Sie ein, um Input abzuleiten). Setzen Sie erwartete Output-Tokens manuell. Schalten Sie Batch-API, gecachte Input-Tokens und Aufrufe pro Tag. Das Prüfdatum auf der Seite ist die letzte Tabellenprüfung — nicht Ihr Rechnungsdatum.

Kostenaufschlüsselung: Frische Eingabe-Tokens, Gecachte Eingabe-Tokens, Ausgabe-Tokens, Batch-API-Rabatt, Gesamt pro Aufruf
Batch-API −50 % auf die Zwischensumme (vereinfachtes v1)
Gecachte Scheibe zu 10 % des Input-Tarifs
Eigene $/1M, wenn Ihr Vertrag von Listenpreisen abweicht
Alle Modelle vergleichen — gleiche Zählungen, jede Registry-Zeile
Szenario — nächtlicher RAG-Batch vs. interaktiver Chat

Sie fahren eine 200k-Input- / 2k-Output-Zusammenfassung 50-mal pro Tag. Die Hälfte des Inputs ist ein stabiles System- plus Korpus-Präfix, das Sie cachen wollen. Interaktiver Chat kann nicht auf ein Batch-Fenster warten.

1

Baseline des interaktiven Aufrufs

200k Input, 2k Output, 0 cached, Batch aus, 50 Aufrufe/Tag. Gesamt pro Aufruf und Pro Monat (30 Tage) ablesen.

2

Cache auf dem stabilen Präfix addieren

Gecachten Input auf die Präfixgröße setzen, die Sie wirklich wiederverwenden (nicht 100 % des Pastes). In der Aufschlüsselung Gecachte Eingabe-Tokens beobachten — günstiger als Frische Eingabe-Tokens; Output bleibt gleich. Batch −50 % gilt danach auf die ganze Zwischensumme, einschließlich dieser bereits reduzierten Scheibe.

3

Nachtjob auf Batch umstellen

Für den nicht-interaktiven Lauf Batch-API aktivieren und Pro Monat (30 Tage) vergleichen. Batch für den latenzsensitiven Chat auslassen — der −50-%-Schalter ist ein Planer, keine Latenzgarantie.

Fazit

Eine nützliche Kostenschätzung trennt Input von Output und testet dann Batch-API- und Prompt-Cache-Hebel an Zählungen vom Zielmodell. Der FastMinify-Preisrechner macht das lokal mit datierter Tariftabelle, flachem −50-%-Batch-Platzhalter, gecachtem Input zu 10 % des Input-Tarifs und einer ×30-Monatslinie. Er trifft die Rechnung nicht auf den Cent — das ist Absicht: hier planen, im Anbieter-Dashboard abstimmen. Zählen Sie zuerst Tokens, wenn Sie noch Volumen brauchen; dann bepreisen Sie die Hebel.

USD pro Aufruf und monatlich aus Ihren Tokenzahlen schätzen

Am Zielmodell zählen, bevor Sie bepreisen
−50 % Batch als v1-Form behandeln, nicht als Angebot
Gecachte Tokens nur für ein gemessenes stabiles Präfix erhöhen
Pro Monat (30 Tage) als 30-Tage-Gerade lesen, nicht als Saisonalität
Prüfdatum, dann Anbieter-Doku prüfen, vor großen Ausgaben
Teilen Sie diesen Artikel
Teilen Sie diesen Artikel: