Zum Inhalt springen
Beyond Prompt AI Studio

Vergleiche

Closed-Source-LLMs im Vergleich

Sechs proprietäre LLM-APIs, einheitlich auf denselben sieben Kriterien bewertet – mit Quellen-Link und Datum je Eintrag, damit du die Angaben selbst nachprüfen kannst. Diese Kategorie richtet sich an Entwickler und technische Entscheider, die eine eigene Anwendung auf einer API aufbauen wollen – nicht an Endnutzer einer fertigen Chat-App (dafür siehe unsere Kategorie „AI-Chat-Assistenten"). Oben an der Tabelle kannst du zwischen Privatkunden- und Geschäftskunden-Perspektive wechseln. Am Ende findest du Szenario-Empfehlungen statt eines einzelnen „Siegers": Welche API passt, hängt von deiner konkreten Situation ab.

Ein Vergleich geschlossener LLM-APIs stellt Angebote wie GPT, Claude, Gemini, Grok, Cohere und Kimi K3 aus Entwickler-Perspektive gegenüber – von Preis pro Token über Rate Limits bis Enterprise-SLA, für alle, die eine eigene Anwendung auf einer API aufbauen wollen.

Wie wir bewerten

Auf einen Blick

Preis-LeistungDatenschutz &HostingLeistung &KontextfensterRate Limits &VerfügbarkeitÖkosystem &ToolingMultimodalitätEnterprise-Reife& Compliance

Automatisch aus den Scores unten berechnet – der grün hervorgehobene Anbieter hat den höchsten Durchschnittsscore über alle Kriterien, keine redaktionelle Einzelauswahl. Anbieter in der Legende an-/abwählen.

Ansicht für
Die Scores bleiben gleich – nur Stärken, Schwächen und Einordnung passen sich der Perspektive an.

Letzter Datenreview: 17.08.2026

Zeile anklicken für Stärken, Schwächen und unsere Einordnung.

Welches Tool passt zu dir?

Höchster Rohleistungs-Benchmark (Coding/Analyse)

GPT (API)

Höchster Benchmark-Wert unter allen sechs verglichenen APIs (96,2 % SWE-bench) zum unveränderten Flaggschiff-Preis.

Agenten- und Tool-Bau mit MCP

Claude (API)

Ursprung und tiefste Integration des MCP-Standards, plus einer der höchsten Benchmark-Werte im Vergleich.

Multimodale Anwendungen aus einer Hand

Gemini (API)

Breiteste Multimodalität (Bild, Video, Audio, vier Bildgenerierungs-Stufen) und beste Zertifizierungslage.

Maximale Kosteneffizienz außerhalb der EU

Grok (API)

Weiterhin die günstigste Flaggschiff-Preisstufe unter den APIs – für EU-Kunden aktuell nur über den Vorgänger Grok 4.3 nutzbar.

Günstige Hochleistungs-API für unkritische Daten

Kimi K3

Drittstärkster Benchmark-Wert im Vergleich zu niedrigen Kosten – aber ohne Zertifizierungen oder EU-Hosting, daher nur für unkritische Daten geeignet.

Das Wichtigste in Kürze

  • GPT (API) liegt mit GPT-5.6 Sol bei 96,2 % SWE-bench zum unveränderten Flaggschiff-Preis von 5 $/30 $ pro Mio. Token – die Spitze des Leaderboards hält inzwischen aber Claude Opus 5 mit 97,0 %.
  • Claude (API) stellt mit Opus 5 (97,0 %) das aktuell stärkste Modell im Vergleich – und das zum halben Preis des eigenen Fable 5 (5 $/25 $ statt 10 $/50 $). Anthropic empfiehlt Opus 5 selbst als Standard-Einstieg; Fable 5 bleibt der Sonderfall für maximale Fähigkeit, allerdings ohne Zero-Data-Retention-Option.
  • Kimi K3 (Moonshot AI) ist neu in diesem Vergleich: drittstärkster Benchmark-Wert (93,4 %) zu einem Bruchteil der Kosten – aber ohne jede Zertifizierung, EU-Hosting oder ZDR-Option, und mit Stand heute noch ohne offene Gewichte (von Moonshot für den 27.07.2026 angekündigt).
  • Grok (API) hat mit 4.5 den größten eigenen Benchmark-Sprung hingelegt, ist laut xAI selbst aber noch nicht in der EU verfügbar – für EU-Kunden bleibt vorerst der Vorgänger Grok 4.3 die nutzbare Option.
  • Cohere hat mit Command A+ überraschend auf offene Gewichte umgeschwenkt (Apache 2.0, kostenlos) – die Rohleistung bleibt aber die schwächste im Vergleich.
  • Gemini (API) bietet unverändert die breiteste Multimodalität und beste Zertifizierungslage unter den sechs APIs.

Selbst hosten, API nutzen oder fertige Lösung kaufen? Build vs. Buy vs. API

Passenden Ansatz für eigene Daten finden: RAG-oder-Fine-Tuning-Finder

Häufige Fragen

Welche LLM-API ist am besten für Coding-Anwendungen?

GPT (API) erzielt mit GPT-5.6 Sol jetzt den höchsten Benchmark-Wert unter den sechs hier verglichenen APIs (96,2 % SWE-bench) – knapp vor Claudes neuem Fable 5 (95,0 %) und Kimi K3 (93,4 %). Claude bleibt aber Ursprung des MCP-Standards (Model Context Protocol) für Tool-Integrationen und hat dort weiterhin das tiefste Ökosystem.

Welche LLM-API ist am günstigsten?

Grok (API) bietet mit 4.5 weiterhin die günstigste Flaggschiff-Preisstufe pro Million Token unter den APIs mit vollem Enterprise-Angebot – für EU-Kunden ist aktuell aber nur der Vorgänger Grok 4.3 verfügbar. Kimi K3 unterbietet Grok beim Input-Preis für Cache-Treffer, liegt aber beim Output-Preis darüber.

Gibt es eine LLM-API mit On-Premise-Deployment für regulierte Branchen?

Cohere ist unter den sechs verglichenen APIs weiterhin die einzige Option mit echtem privatem/On-Premise-Deployment (Model Vault, BYOC) – seit Mai 2026 zusätzlich mit offenen Gewichten (Command A+, Apache 2.0) für alle, die selbst hosten wollen.

Ist Kimi K3 ein offenes oder ein geschlossenes Modell?

Mit Stand 21.07.2026 ist Kimi K3 ein reines API-Modell ohne öffentlich verfügbare Gewichte – Moonshot AI hat die Veröffentlichung offener Gewichte für den 27.07.2026 angekündigt, aber noch nicht eingelöst. Deshalb steht Kimi K3 aktuell in dieser Kategorie und nicht bei den Open-Source-LLMs; sollte die Ankündigung eintreffen, prüfen wir eine Einordnung dort.

Warum ist Cohere hier gelistet, obwohl Command A+ offene Gewichte hat?

Cohere wird in dieser Kategorie primär wegen seines API-/Enterprise-Geschäftsmodells bewertet (Model Vault, verwaltete Rerank-/Embed-Dienste, Vertriebsprozess für Enterprise-Konditionen), nicht wegen der Gewichte selbst. Anders als bei den Modellen in unserer Open-Source-Kategorie steht bei Cohere die verwaltete Plattform im Vordergrund – die offenen Gewichte von Command A+ sind eine zusätzliche Self-Hosting-Option, keine Neuausrichtung des Geschäftsmodells.

Was ist der Unterschied zwischen dieser Kategorie und AI-Chat-Assistenten?

Diese Kategorie bewertet die APIs aus Entwickler-Perspektive (Preis pro Token, Kontextfenster, SDKs, Rate Limits) für eigene Anwendungen. Die Kategorie AI-Chat-Assistenten vergleicht dagegen die fertigen Consumer-Chat-Apps (ChatGPT, Claude.ai, Gemini-App usw.) für Endnutzer.