LLM-Tokens zählen und API-Kosten lokal schätzen (OpenAI, Claude, Gemini)

LLM-Tokens zählen und API-Kosten lokal schätzen (OpenAI, Claude, Gemini)

Vor dem LLM-API-Aufruf: Tokens zählen, USD-Kosten schätzen und Kontextfenster prüfen — 100 % im Browser, ohne Ihren Prompt zu senden.

14.08.2026
7 Min. Lektüre
Teilen Sie diesen Artikel:
llm
tokens
pricing
openai
anthropic
gemini
ai
Anleitung

Warum Tokens zählen, bevor Sie eine LLM-API aufrufen?

Jede Anfrage an OpenAI, Anthropic oder Google wird in Eingabe-Tokens und Ausgabe-Tokens abgerechnet — nicht in Wörtern oder Zeichen. Ein langer System-Prompt, Few-Shot-Beispiele oder Multi-Turn-Historie verbrauchen das Kontextfenster-Budget bevor Ihre Nutzerfrage. Ohne Vorabmessung treffen Sie auf Truncation-Fehler oder eine überraschende Rechnung am Monatsende. Auf FastMinify laufen der LLM-Token-Zähler, der LLM-Preisrechner und der Context-Window-Rechner vollständig im Browser — Ihr Text verlässt das Gerät nie. Entdecken Sie den KI- & LLM-Tools-Hub für den kompletten Workflow.

USD-Kosten pro Aufruf vor dem API-Request abschätzen
Prüfen, ob Prompt + Historie ins Kontextfenster des Zielmodells passen
Mehrere Modelle (GPT, Claude, Gemini) am gleichen Text vergleichen
100 % lokal — keine Aufrufe an Provider-Tokenizer oder APIs
Schneller Workflow: einfügen, zählen, schätzen, anpassen — ohne Konto oder Installation

Ehrliche Grenzen und Best Practices

Was diese Tools nicht ersetzen

FastMinify zielt auf schnelle Browser-Planung — nicht auf Buchhaltungsabgleich oder Runtime-Optimierung.

Keine Provider-Billing-APIs — manuelle Tariftabelle, nur USD in v1
Estimate-Tier (Claude, Gemini): ±5–15 % — nicht allein für enge Budgets nutzen
Keine Bild-, Audio- oder Tool-Call-Token-Regeln in v1
Output-Tokens in Preisrechner v1 nicht automatisch abgeleitet
Echte Rechnungen können Rabatte, Regionen oder Cached-Token-Nuancen enthalten — Provider-Dashboard prüfen
Tokens und Kosten vor dem Aufruf reduzieren

Zählen zeigt oft offensichtliches Fett in System-Prompts und doppeltem Kontext.

System-Anweisungen kürzen — jedes Token wiederholt sich pro Request
RAG-Kontext deduplizieren — keine fast identischen Chunks erneut senden
Kleineres Modell für einfache Tasks — via Compare all models vergleichen
Batch-API für nicht latenzkritische Workloads — −50 %-Hebel im Rechner
Prompt-Caching für stabile System-Prompts — cached Slice separat modellieren
Datenschutz und sensible Daten

Anders als viele Online-Zähler, die Text an einen Server senden, tokenisiert FastMinify lokal. Nützlich für Prompts mit proprietärem Code, PII oder internen Specs.

Kein Server-Logging des eingefügten Inhalts — nur clientseitige Verarbeitung
Kein Konto nötig — keine Identitäts-↔-Prompt-Korrelation
512 KiB max — sehr große Payloads vor dem Zählen aufteilen
Message-JSON lokal mit json-formatter formatieren vor API-Messages-Modus
Für Produktion: API-Logs instrumentieren (Usage-Tokens vom Provider) ergänzend

Tokens, tiktoken und Heuristiken: was Sie wirklich messen

Tokens ≠ Wörter ≠ Zeichen

Ein Token kann ein ganzes Wort, eine Silbe, Satzzeichen oder ein Fragment sein. „Entwicklung“ kann je nach Modell mehrere Tokens sein; „API“ oft nur eines. Deshalb ersetzt ein Wortzähler keinen Token-Zähler für LLM-Abrechnung.

Provider berechnen pro Million Tokens — Input und Output getrennt
API-Messages-Modus fügt ChatML-Overhead hinzu (+3 Tokens pro Message, +1 pro name, +3 Reply-Priming)
Tool-Definitionen, strukturiertes JSON und Code-Blöcke zählen als tokenisierter Text
Der gleiche Prompt kann zwischen Modellen leicht variieren — am Zielmodell vergleichen
Message-JSON zuerst mit dem JSON-Formatter formatieren, um Parse-Fehler zu vermeiden
Exact (OpenAI) vs Estimate (Claude, Gemini)

FastMinify lädt js-tiktoken bei Bedarf für OpenAI-Modelle (o200k_base oder cl100k_base) und zeigt das Badge Exact. Für Claude und Gemini veröffentlichen Anthropic und Google keinen Browser-Tokenizer — wir wenden eine Zeichen-pro-Token-Heuristik an (typisch ±5–15 %) mit dem Badge Estimate.

Exact — js-tiktoken lazy-load, gleiche Encoding-Familie wie OpenAI-Doku
Estimate — konservative Heuristik, nie als offizielle Abrechnung dargestellt
Auto-Modus: erkennt Rohtext vs JSON-Messages-Array
API-Messages-Modus: [{"role","content"}]-Array mit ChatML-Overhead
Bei OpenAI byte-exact-Streitigkeiten: offiziellen OpenAI-Tokenizer vergleichen
Input, Output und Kontextfenster

Kosten hängen von beiden Richtungen ab: Prompt (Input) und Completion (Output). Das Kontextfenster begrenzt Input + reserviertes Output — der Context-Window-Rechner zieht eine Output-Reserve ab (Standard 15 %), um das effektive Input-Budget zu schätzen.

Input-Tokens — System-Prompt, RAG, Historie, Nutzerfrage
Output-Tokens — manuell im Preisrechner eingeben (v1 leitet sie nicht aus dem Prompt ab)
Kontextfenster — veröffentlichtes Limit pro Modell (manuell gepflegte Tabelle auf FastMinify)
Status Safe / Near limit / Won't fit nach % des verbrauchten effektiven Budgets
Großes RAG: injizierten Kontext getrennt von der Nutzernachricht zählen

Drei-Tool-Workflow: zählen, schätzen, Fenster prüfen

Schritt 1 — Mit dem LLM-Token-Zähler zählen

Fügen Sie Ihren Prompt oder ein JSON-Messages-Array in den LLM-Token-Zähler ein. Max 512 KiB UTF-8. Compare all models für Zähler über das gesamte Registry.

Rohtext oder API-Messages-JSON-Modus
Exact-Badge (OpenAI) oder Estimate-Badge (Claude, Gemini) pro Modell
BPE-Token-Pill-Visualisierung nur für Exact-Tier-Modelle
Lokales Zählen — kein Upload zu OpenAI, Anthropic oder Google
Zähler kopieren für den Preisrechner
Schritt 2 — USD-Kosten schätzen

Übertragen Sie Input/Output-Token-Zähler in den LLM-Preisrechner, oder fügen Sie den Prompt ein, um Input-Tokens über dieselbe countTokensAsync-Pipeline abzuleiten. Tarife stammen aus einer manuell geprüften llm-models.json-Tabelle — Verified-Datum auf dem Tool.

Input / Output / Total USD pro Aufruf
Batch-API-Hebel (−50 % vereinfacht auf Zwischensumme)
Prompt-Caching-Hebel — cached Slice zu 10 % des Input-Tarifs
Monatsprojektion: Aufrufe/Tag × 30 Tage
Compare all models — Kostentabelle für alle Registry-Modelle
Schritt 3 — Kontextfenster prüfen

Der Context-Window-Rechner nutzt dieselbe Zählpipeline und vergleicht Ihren Prompt mit dem effektiven Budget (Fenster − Output-Reserve). Ideal vor Multi-Turn-Agenten oder großen RAG-Pastes.

Konfigurierbare Output-Reserve (Standard 15 %)
Status Safe (<80 %), Near limit (≥80 %), Won't fit (Überlauf)
Pro-Modell-Ansicht auf dem FastMinify-Registry
Gleiches 512-KiB-Limit und Exact/Estimate-Tiers
Nach bestätigter Marge zum Preisrechner wechseln
Szenario — RAG-Prototyp vor Produktion

Sie bauen System-Prompt + 20 Vektor-Chunks + Nutzerfrage für GPT-4o.

1

Vollen Kontext zählen

Alles (oder das Messages-Array) in den Token-Zähler einfügen. Input-Tokens am Zielmodell notieren und Exact- vs Estimate-Badge prüfen.

2

Kontext-Marge testen

Context-Window-Rechner mit dem gleichen Text öffnen. Bei Near limit oder Won't fit Chunks kürzen oder Modell mit größerem Fenster wählen.

3

Monatskosten projizieren

Im Preisrechner Input-Tokens eingeben, Output-Tokens schätzen (z. B. 500), Caching aktivieren wenn System-Prompt stabil, dann mit erwarteten Aufrufen/Tag multiplizieren.

Fazit

Tokens vor dem API-Aufruf zu zählen vermeidet Truncation- und Abrechnungsüberraschungen. Nutzen Sie den LLM-Token-Zähler für eine ehrliche Aufschlüsselung (Exact für OpenAI, Estimate sonst), den Context-Window-Rechner für RAG- oder Multi-Turn-Marge, dann den Preisrechner für USD-Projektion — alles im Browser, ohne Ihren Prompt an Provider zu senden.

Am Zielmodell zählen — Tokens variieren zwischen Familien
Estimate als Planung behandeln, nicht als offizielle Claude/Gemini-Abrechnung
Output-Marge im Context-Window-Rechner reservieren
Tarif-Verified-Datum im Preisrechner vor großen Budgets prüfen
Word-counter für SEO-Textstatistik, Token-Zähler für LLM-Abrechnung kombinieren
Teilen Sie diesen Artikel
Teilen Sie diesen Artikel: