Vergleiche
Closed-Source-LLMs im Vergleich
Sechs proprietäre LLM-APIs, einheitlich auf denselben sieben Kriterien bewertet – mit Quellen-Link und Datum je Eintrag, damit du die Angaben selbst nachprüfen kannst. Diese Kategorie richtet sich an Entwickler und technische Entscheider, die eine eigene Anwendung auf einer API aufbauen wollen – nicht an Endnutzer einer fertigen Chat-App (dafür siehe unsere Kategorie „AI-Chat-Assistenten"). Oben an der Tabelle kannst du zwischen Privatkunden- und Geschäftskunden-Perspektive wechseln. Am Ende findest du Szenario-Empfehlungen statt eines einzelnen „Siegers": Welche API passt, hängt von deiner konkreten Situation ab.
Ein Vergleich geschlossener LLM-APIs stellt Angebote wie GPT, Claude, Gemini, Grok, Cohere und Kimi K3 aus Entwickler-Perspektive gegenüber – von Preis pro Token über Rate Limits bis Enterprise-SLA, für alle, die eine eigene Anwendung auf einer API aufbauen wollen.
Wie wir bewerten →Auf einen Blick
Automatisch aus den Scores unten berechnet – der grün hervorgehobene Anbieter hat den höchsten Durchschnittsscore über alle Kriterien, keine redaktionelle Einzelauswahl. Anbieter in der Legende an-/abwählen.
Letzter Datenreview: 17.08.2026
Zeile anklicken für Stärken, Schwächen und unsere Einordnung.
| Tool | Preis | Preis-Leistung | Datenschutz & Hosting | Leistung & Kontextfenster | Rate Limits & Verfügbarkeit | Ökosystem & Tooling | Multimodalität | Enterprise-Reife & Compliance | Ideal für | Mehr erfahren |
|---|---|---|---|---|---|---|---|---|---|---|
GPT (API) OpenAI | 5 $/Mio. Input- · 30 $/Mio. Output-Token (Flaggschiff Sol) · günstigere Terra- (2 $/12 $) und Luna-Tarife (0,20 $/1,20 $) | 5 von 5 | 4 von 5 | 5 von 5 | 4 von 5 | 5 von 5 | 4 von 5 | 5 von 5 | Entwickler, die maximale Rohleistung zum bekannten Preis wollen +1 | |
Claude (API) Anthropic | 10 $/Mio. Input- · 50 $/Mio. Output-Token (Fable 5) · günstigeres Opus 5 (5 $/25 $) und Sonnet-5-/Haiku-Tarife | 3 von 5 | 2 von 5 | 5 von 5 | 3 von 5 | 5 von 5 | 2 von 5 | 4 von 5 | Coding- und Analyse-lastige Projekte mit Bedarf an maximaler Textqualität +1 | |
Gemini (API) | 2 $/Mio. Input- (bis 200k Token, danach 4 $) · 12 $/Mio. Output-Token (bis 200k Token, danach 18 $) (3.1 Pro) · günstigere Flash-Tarife | 4 von 5 | 4 von 5 | 5 von 5 | 3 von 5 | 3 von 5 | 5 von 5 | 5 von 5 | Multimodale Projekte (Bild, Audio, Video in einem Modell) +1 | |
Grok (API) xAI | 2 $/Mio. Input- · 6 $/Mio. Output-Token (<200k Token; unverändert zu 4.5, jetzt auch für 4.6) · laut xAI noch nicht in der EU verfügbar · Vorgänger 4.3 (1,25 $/2,50 $) für EU-Kunden nutzbar | 5 von 5 | 2 von 5 | 4 von 5 | 3 von 5 | 4 von 5 | 4 von 5 | 2 von 5 | Preisbewusste Entwickler außerhalb der EU, die eine OpenAI-kompatible API suchen +1 | |
Cohere Cohere | Command A+ jetzt Apache 2.0/offene Gewichte, kostenlos herunterladbar · Model Vault ab 4 $/Stunde bzw. 2.500 $/Monat · ältere Command-R/R+-Tarife weiter kostenpflichtig | 3 von 5 | 5 von 5 | 2 von 5 | 3 von 5 | 4 von 5 | 2 von 5 | 5 von 5 | RAG-/Retrieval-lastige Projekte mit Bedarf an Rerank/Embed +1 | |
Kimi K3 Moonshot AI | 0,30 $/Mio. Input (Cache-Hit) · 3 $/Mio. Input (Cache-Miss) · 15 $/Mio. Output-Token · aktuell nur als API, keine offenen Gewichte | 4 von 5 | 1 von 5 | 5 von 5 | 2 von 5 | 2 von 5 | 3 von 5 | 1 von 5 | Preisbewusste Entwickler mit unkritischen Daten, die maximale Rohleistung wollen +1 | |
Welches Tool passt zu dir?
Höchster Rohleistungs-Benchmark (Coding/Analyse)
GPT (API)
Höchster Benchmark-Wert unter allen sechs verglichenen APIs (96,2 % SWE-bench) zum unveränderten Flaggschiff-Preis.
Agenten- und Tool-Bau mit MCP
Claude (API)
Ursprung und tiefste Integration des MCP-Standards, plus einer der höchsten Benchmark-Werte im Vergleich.
Multimodale Anwendungen aus einer Hand
Gemini (API)
Breiteste Multimodalität (Bild, Video, Audio, vier Bildgenerierungs-Stufen) und beste Zertifizierungslage.
Maximale Kosteneffizienz außerhalb der EU
Grok (API)
Weiterhin die günstigste Flaggschiff-Preisstufe unter den APIs – für EU-Kunden aktuell nur über den Vorgänger Grok 4.3 nutzbar.
Günstige Hochleistungs-API für unkritische Daten
Kimi K3
Drittstärkster Benchmark-Wert im Vergleich zu niedrigen Kosten – aber ohne Zertifizierungen oder EU-Hosting, daher nur für unkritische Daten geeignet.
Das Wichtigste in Kürze
- GPT (API) liegt mit GPT-5.6 Sol bei 96,2 % SWE-bench zum unveränderten Flaggschiff-Preis von 5 $/30 $ pro Mio. Token – die Spitze des Leaderboards hält inzwischen aber Claude Opus 5 mit 97,0 %.
- Claude (API) stellt mit Opus 5 (97,0 %) das aktuell stärkste Modell im Vergleich – und das zum halben Preis des eigenen Fable 5 (5 $/25 $ statt 10 $/50 $). Anthropic empfiehlt Opus 5 selbst als Standard-Einstieg; Fable 5 bleibt der Sonderfall für maximale Fähigkeit, allerdings ohne Zero-Data-Retention-Option.
- Kimi K3 (Moonshot AI) ist neu in diesem Vergleich: drittstärkster Benchmark-Wert (93,4 %) zu einem Bruchteil der Kosten – aber ohne jede Zertifizierung, EU-Hosting oder ZDR-Option, und mit Stand heute noch ohne offene Gewichte (von Moonshot für den 27.07.2026 angekündigt).
- Grok (API) hat mit 4.5 den größten eigenen Benchmark-Sprung hingelegt, ist laut xAI selbst aber noch nicht in der EU verfügbar – für EU-Kunden bleibt vorerst der Vorgänger Grok 4.3 die nutzbare Option.
- Cohere hat mit Command A+ überraschend auf offene Gewichte umgeschwenkt (Apache 2.0, kostenlos) – die Rohleistung bleibt aber die schwächste im Vergleich.
- Gemini (API) bietet unverändert die breiteste Multimodalität und beste Zertifizierungslage unter den sechs APIs.
→ Selbst hosten, API nutzen oder fertige Lösung kaufen? Build vs. Buy vs. API
→ Passenden Ansatz für eigene Daten finden: RAG-oder-Fine-Tuning-Finder
Häufige Fragen
Welche LLM-API ist am besten für Coding-Anwendungen?
GPT (API) erzielt mit GPT-5.6 Sol jetzt den höchsten Benchmark-Wert unter den sechs hier verglichenen APIs (96,2 % SWE-bench) – knapp vor Claudes neuem Fable 5 (95,0 %) und Kimi K3 (93,4 %). Claude bleibt aber Ursprung des MCP-Standards (Model Context Protocol) für Tool-Integrationen und hat dort weiterhin das tiefste Ökosystem.
Welche LLM-API ist am günstigsten?
Grok (API) bietet mit 4.5 weiterhin die günstigste Flaggschiff-Preisstufe pro Million Token unter den APIs mit vollem Enterprise-Angebot – für EU-Kunden ist aktuell aber nur der Vorgänger Grok 4.3 verfügbar. Kimi K3 unterbietet Grok beim Input-Preis für Cache-Treffer, liegt aber beim Output-Preis darüber.
Gibt es eine LLM-API mit On-Premise-Deployment für regulierte Branchen?
Cohere ist unter den sechs verglichenen APIs weiterhin die einzige Option mit echtem privatem/On-Premise-Deployment (Model Vault, BYOC) – seit Mai 2026 zusätzlich mit offenen Gewichten (Command A+, Apache 2.0) für alle, die selbst hosten wollen.
Ist Kimi K3 ein offenes oder ein geschlossenes Modell?
Mit Stand 21.07.2026 ist Kimi K3 ein reines API-Modell ohne öffentlich verfügbare Gewichte – Moonshot AI hat die Veröffentlichung offener Gewichte für den 27.07.2026 angekündigt, aber noch nicht eingelöst. Deshalb steht Kimi K3 aktuell in dieser Kategorie und nicht bei den Open-Source-LLMs; sollte die Ankündigung eintreffen, prüfen wir eine Einordnung dort.
Warum ist Cohere hier gelistet, obwohl Command A+ offene Gewichte hat?
Cohere wird in dieser Kategorie primär wegen seines API-/Enterprise-Geschäftsmodells bewertet (Model Vault, verwaltete Rerank-/Embed-Dienste, Vertriebsprozess für Enterprise-Konditionen), nicht wegen der Gewichte selbst. Anders als bei den Modellen in unserer Open-Source-Kategorie steht bei Cohere die verwaltete Plattform im Vordergrund – die offenen Gewichte von Command A+ sind eine zusätzliche Self-Hosting-Option, keine Neuausrichtung des Geschäftsmodells.
Was ist der Unterschied zwischen dieser Kategorie und AI-Chat-Assistenten?
Diese Kategorie bewertet die APIs aus Entwickler-Perspektive (Preis pro Token, Kontextfenster, SDKs, Rate Limits) für eigene Anwendungen. Die Kategorie AI-Chat-Assistenten vergleicht dagegen die fertigen Consumer-Chat-Apps (ChatGPT, Claude.ai, Gemini-App usw.) für Endnutzer.