Die Auswahl an KI-Sprachmodellen wächst rasant – und damit auch die Unterschiede bei den Kosten. Ob günstiger Einstieg oder leistungsstarke Premium-Lösung: Wer das richtige Modell für seinen Anwendungsfall wählt, kann die Kosten um mehr als den Faktor 100 senken. Das interaktive Diagramm zeigt auf einen Blick, was die gängigsten LLMs je 1 Million Tokens kosten – für Input, Output oder beides zusammen.
Was kostet welches KI-Modell?
Preis je 1 Mio. Tokens in Euro · Stand Juli 2026
Euro je 1 Mio. Tokens
* Richtwerte der Standard-API, umgerechnet zu 1 USD ≈ 0,88 € (EZB, Juli 2026). Rabatte für Prompt-Caching & Batch-Verarbeitung nicht eingerechnet.
Links zu den Modellen
Das falsche Modell kann richtig teuer werden
Die Preisunterschiede zwischen den verfügbaren Modellen sind enorm. Während ein schlankes Modell wie Mistral Small 4, GPT-5.4 Nano oder Gemini 2.5 Flash-Lite für unter 0,10 € pro Million Input-Tokens zu haben ist, kosten Hochleistungsmodelle wie GPT-5.5 Pro oder Claude Fable 5 ein Vielfaches davon – bei den Output-Tokens teils das über 100-Fache. Wer diese Unterschiede ignoriert und pauschal auf das bekannteste oder leistungsfähigste Modell setzt, zahlt am Ende deutlich mehr als nötig.
Input- vs. Output-Tokens: ein oft unterschätzter Faktor
Besonders wichtig ist das Verhältnis zwischen Input- und Output-Tokens. Input-Tokens sind die Informationen, die man an das Modell schickt (Prompts, Kontext, Dokumente). Output-Tokens sind die generierten Antworten. In der Regel sind Output-Tokens 3- bis 6-mal teurer als Input-Tokens – ein Faktor, der bei der Kostenplanung häufig unterschätzt wird. Bei GPT-5.5 Pro etwa liegt der Output-Preis sechsmal so hoch wie der Input-Preis, bei Claude Opus 4.8 fünfmal.
Wer viele lange Antworten generiert, sollte deshalb gezielt Modelle bevorzugen, die bei den Output-Preisen günstig abschneiden. Das interaktive Diagramm oben ermöglicht genau diesen Vergleich – mit der Möglichkeit, zwischen Input-, Output- oder einer kombinierten Ansicht zu wechseln.
Die wichtigsten Anbieter im Überblick
Der Markt teilt sich weiterhin auf einige wenige dominante Anbieter auf:
OpenAI bietet mit der GPT-5-Familie eine breite Palette. Die neue GPT-5.6-Generation ist in drei Stufen abgestuft: GPT-5.6 Sol als Flaggschiff (2,20 / 13,20 €), GPT-5.6 Terra als Mittelklasse (1,10 / 6,60 €) und GPT-5.6 Luna als günstige Variante (0,44 / 2,64 €). Nach unten reicht die Palette bis GPT-5.4 Nano (0,09 / 0,55 €), nach oben bildet GPT-5.5 Pro mit 13,20 / 79,20 € die Premium-Spitze.
Anthropic hat mit Claude Fable 5 (8,80 / 44,00 €) ein neues, kreativ orientiertes Spitzenmodell im Programm. Darunter positionieren sich Claude Opus 4.8 (4,40 / 22,00 €), Claude Sonnet 5 (2,64 / 13,20 €) und der günstige Claude Haiku 4.5 (0,88 / 4,40 €) – mit starkem Fokus auf Zuverlässigkeit und lange Kontextfenster.
Google Gemini überzeugt vor allem durch ein großzügiges kostenloses Kontingent und sehr günstige Flash-Modelle. Gemini 2.5 Flash-Lite gehört mit 0,09 / 0,35 € zu den preiswertesten Optionen überhaupt, während Gemini 3.1 Pro (1,76 / 10,56 €) die Leistungsspitze bildet.
DeepSeek hat den Markt mit aggressiv niedrigen Preisen aufgemischt: DeepSeek V4 Flash liefert starke Leistung für 0,12 / 0,25 €, das größere V4 Pro für 0,38 / 0,77 €.
Mistral punktet als europäischer Anbieter mit DSGVO-konformer Infrastruktur und wettbewerbsfähigen Preisen – von Mistral Small 4 (0,09 / 0,26 €) bis Mistral Large 3 (1,76 / 5,28 €).
xAI (Grok) bietet mit einem sehr großen Kontextfenster einen Vorteil für Anwendungen mit langen Dokumenten. Grok 4.1 Fast ist mit 0,18 / 0,44 € bemerkenswert günstig, das Spitzenmodell Grok 4 kostet 2,64 / 13,20 €.
Welches Modell passt zu welchem Anwendungsfall?
| Anwendungsfall | Empfehlung |
|---|---|
| Einfache Textaufgaben, hohes Volumen | Gemini 2.5 Flash-Lite, GPT-5.4 Nano, Mistral Small 4 |
| Coding & Entwicklung | GPT-5.6 Sol, Claude Sonnet 5, DeepSeek V4 Pro |
| Komplexe Analysen & Recherche | Claude Opus 4.8, GPT-5.5 Pro |
| Kreatives Schreiben & Storytelling | Claude Fable 5, Claude Opus 4.8 |
| Lange Dokumente (>200K Tokens) | Gemini 3.1 Pro, Grok 4 |
| DSGVO-konform (EU-Hosting) | Mistral Large 3, Mistral Medium 3.5 |
| Maximale Leistung, Kosten egal | GPT-5.5 Pro, Claude Fable 5 |
Zusätzliche Sparpotenziale
Neben dem reinen Modellpreis bieten viele Anbieter weitere Rabattmöglichkeiten:
Prompt Caching: Wiederkehrende Kontext-Tokens werden zwischengespeichert und kosten nur 10–30 % des normalen Input-Preises.
Batch-API: Die asynchrone Verarbeitung großer Anfragemengen wird bei den meisten Anbietern mit rund 50 % Rabatt belohnt.
Free Tiers: Google Gemini und mehrere Open-Source-Modelle sind für Prototyping und kleine Projekte kostenlos nutzbar.
