Boris Agatić · · 10 Min. Lesezeit

KI-Anbieter auswählen 2026: Anthropic vs OpenAI vs Google vs Mistral vs Manus — eine Scorecard für Unternehmen

In der letzten Septemberwoche kamen drei Spitzenmodelle — Claude Sonnet 5.5, GPT-6.1 Sol und Gemini 4 Argon — zum gleichen Preis auf den Markt: 2 USD pro Million Input-Tokens und 10 USD pro Million Output-Tokens. Wenn der Preis nicht mehr entscheidet, wird die Wahl des KI-Anbieters zu einer echten Beschaffungsentscheidung: Qualität bei Ihren eigenen Aufgaben, Sicherheit, Datenresidenz, Integration, Vertragsbedingungen und die Kosten eines späteren Wechsels. Dieser Leitfaden liefert eine gewichtete Scorecard, die Bereitstellungsoptionen jedes Anbieters, die wichtigen Vertragsklauseln und einen 30-Tage-Auswahlprozess.

2 / 10 USD
pro 1 Mio. Tokens: Sonnet 5.5, GPT-6.1 Sol und Gemini 4 Argon kosten gleich viel
40 %
Anteil von Anthropic an den LLM-API-Ausgaben von Unternehmen Ende 2025, nach 12 % im Jahr 2023 (Menlo Ventures)
37 %
der Unternehmen nutzen bereits fünf oder mehr Modelle produktiv (a16z-CIO-Umfrage, 2025)

Warum sich die Anbieterwahl 2026 verändert hat

Vor drei Jahren war die Wahl einfach: OpenAI hatte das beste Modell, alle anderen holten auf. Diesen Markt gibt es nicht mehr. Die Unternehmensumfragen von Menlo Ventures zeigen, dass OpenAIs Anteil an den LLM-API-Ausgaben von Unternehmen von rund 50 % im Jahr 2023 auf 27 % Ende 2025 gefallen ist, während Anthropic von 12 % auf 40 % und Google von 7 % auf 21 % stieg. In der Softwareentwicklung — dem größten einzelnen Anwendungsfall in Unternehmen — war Anthropics Anteil noch höher. Die Führung bei Benchmarks wechselt inzwischen alle paar Wochen: Opus 5.5 stellte am 22. September einen neuen Rekord bei SWE-bench Pro auf, acht Tage später übernahm Gemini 4 Argon die Spitze bei den meisten von Google veröffentlichten Tests.

Anteil an den LLM-API-Ausgaben von Unternehmen (Umfragen von Menlo Ventures)

Vier Kräfte machen die Anbieterwahl heute zu einer anderen Aufgabe als vor einem Jahr:

Die sechs Kriterien — und wie man sie gewichtet

Eine gute Auswahl bewertet jeden Anbieter nach denselben Kriterien, mit Gewichtungen, die vor der ersten Demo vereinbart werden. Mit diesen Gewichtungen starten wir bei Kunden; passen Sie sie an Ihr Risikoprofil an.

Empfohlene Startgewichtungen für eine KI-Anbieter-Scorecard
KriteriumGewichtWas zu prüfen ist
Qualität bei Ihren Aufgaben30 %Blind bewertete Ergebnisse bei 50–100 echten Aufgaben in Ihren Sprachen (inklusive Deutsch und Kroatisch), keine öffentlichen Ranglisten
Sicherheit & Compliance20 %ISO 27001 / SOC 2, AVV, kein Training mit Ihren Daten, Zero Data Retention, Sicherheitsverhalten von Agenten, Unterstützung beim EU AI Act
Gesamtkosten15 %Kosten pro erledigter Aufgabe (Tokens × Preis, Caching, Batch), Lizenzpreise, Rabatte für zugesagtes Volumen
Integration & Ökosystem15 %Verfügbarkeit in Ihrer Cloud, Office / Workspace, SSO, Konnektoren, MCP, Agenten- und Coding-Tools
Datenresidenz & Souveränität10 %Verarbeitung in der EU, regionale Endpunkte, Self-Hosting oder offene Gewichte, Rechtsraum des Anbieters
Anbieterstabilität & Exit10 %Finanzkraft, Roadmap, Abkündigungsrichtlinie, Portabilität von Prompts, Evaluationen und Daten

Die Anbieter im Überblick

Anthropic (Claude)

Der Marktführer bei Unternehmens-APIs. Claude Opus 5.5 und Sonnet 5.5 sind die stärkste Wahl für Programmierung, Agenten und lange Dokumente (1 Mio. Tokens Kontext), und Claude läuft nativ in AWS Bedrock, Google Cloud Vertex AI und Microsoft Azure, in Excel, Word und PowerPoint sowie in Microsoft 365 Copilot. Der Sicherheitsansatz — Enterprise Frontier Safeguards mit Zero Data Retention, gestufter Zugang zu Mythos — spricht regulierte Branchen an. Schwächen: Die Opus-Spitzenstufe ist teurer als die Mittelklasse der Konkurrenz, und es gibt keine offenen Gewichte für Self-Hosting.

OpenAI (GPT, ChatGPT, Codex)

Das breiteste Ökosystem. ChatGPT erreicht rund 1,2 Milliarden Nutzer pro Woche — die Nutzung in Ihrem Unternehmen findet oft schon statt. Der DevDay 2026 machte ChatGPT zur Agentenplattform mit dauerhaften Dots-Agenten, einem Enterprise-Marktplatz für Apps und Space für die gemeinsame Arbeit. GPT-6.1 Sol bietet nahezu Spitzenleistung beim Programmieren zum Mittelklassepreis, Azure OpenAI gibt Microsoft-Kunden einen vertrauten Beschaffungsweg, und die gpt-oss-Modelle mit offenen Gewichten decken einen Teil des Self-Hosting-Bedarfs ab. Beobachten Sie die Agenten-Governance nach dem Fall Astra.

Google (Gemini)

Die stärkste Wahl für Unternehmen mit Google Workspace und für multimodale Arbeit — Video, Bilder und sehr lange Ausgaben (Gemini 4 Argon hob das Output-Limit auf 1 Mio. Tokens). Vertex AI bietet EU-Regionen und ausgereifte Data-Governance-Kontrollen, und Googles Bilanz macht es zur sichersten Wette in Sachen Anbieterstabilität. Gemini ist nicht nativ auf AWS oder Azure verfügbar, und das neueste Flaggschiff ist zunächst ausgewählten Testern vorbehalten.

Mistral (Le Chat, Mistral-Modelle)

Die europäische Option. Mistrals Modelle laufen auf eigener EU-Infrastruktur, bei allen drei Hyperscalern und — dank offener Gewichte — auf Ihren eigenen Servern. Für volumenstarke Aufgaben wie Klassifizierung, Extraktion und Übersetzung ist Mistral meist die günstigste Option, und Le Chat bietet 65+ Konnektoren für einen in der EU gehosteten Assistenten. Bei der reinen Leistungsfähigkeit liegt Mistral hinter der US-Spitze, verspricht aber, mit der nächsten Generation einen Großteil der Lücke zu schließen; der neue Standort München rückt das Unternehmen zudem näher an die deutsche Industrie. Für souveränitätsgetriebene Käufer ist Mistral oft der richtige Hauptanbieter, für andere ein starker Zweitanbieter.

Manus

Manus ist ein autonomes Agentenprodukt, keine Modellplattform. Es verwandelt ein Ziel hervorragend in einen fertigen Recherchebericht, eine Tabelle oder eine Präsentation und eignet sich für Teams, die Ergebnisse wollen, ohne etwas zu entwickeln. Behandeln Sie es als Werkzeug, das Sie für eine bestimmte Aufgabe kaufen, nicht als Fundament Ihres KI-Stacks: Es gibt kein Self-Hosting, nur begrenzte Kontrolle über die Datenresidenz, und Sie hängen von den zugrunde liegenden Modellen ab, die Manus wählt.

Die Scorecard

Wendet man die Startgewichtungen auf unsere redaktionellen Bewertungen an (1–5 je Kriterium, Oktober 2026), liegen Anthropic, OpenAI und Google nur zwei Punkte auseinander. Das ist die eigentliche Lehre: Unter den großen Drei entscheiden Ihre Gewichtungen und Ihre eigenen Tests, nicht der Anbieter. Wechseln Sie zu einer souveränitätsorientierten Gewichtung (30 % Datenresidenz, 20 % Qualität), und Mistral zieht mit den US-Marktführern gleich.

Gewichtete Anbieterbewertung von 100 — zwei Gewichtungsprofile
Kopieren Sie nicht unsere Bewertungen — kopieren Sie die Methode. Eine Anwaltskanzlei in Zagreb, die Verträge auf Kroatisch entwirft, ein deutscher Maschinenbauer, der Inferenz on-premise braucht, und ein Softwarehaus, das in Claude Code lebt, werden dieselben fünf Anbieter völlig unterschiedlich einstufen. Legen Sie zuerst die Gewichtungen fest und lassen Sie dann 50–100 Ihrer eigenen Aufgaben entscheiden, blind bewertet von Ihren Fachleuten. Unser Leitfaden zur Evaluation mit LLM-als-Richter zeigt, wie sich ein Teil der Bewertung automatisieren lässt.

Wo Sie welchen Anbieter betreiben können

Bereitstellungskanäle entscheiden mehr Auswahlverfahren als Benchmarks. Liegen alle Ihre Daten in AWS, übernimmt ein in Bedrock verfügbares Modell Ihre bestehende Sicherheitsprüfung, Abrechnung und Netzwerkkontrollen; müssen die Daten auf eigenen Servern bleiben, kommen nur Modelle mit offenen Gewichten infrage.

Bereitstellungskanäle nach Anbieter (Oktober 2026)

Die Vertragsklauseln, auf die es ankommt

Die Modellqualität ändert sich jeden Monat; Ihr Vertrag läuft über Jahre. Stellen Sie vor der Unterschrift sicher, dass er Folgendes abdeckt:

  1. Kein Training mit Ihren Daten — Eingaben, Ausgaben und Dateien — im Vertrag festgeschrieben, nicht nur auf einer Richtlinienseite.
  2. Auftragsverarbeitungsvertrag und Liste der Unterauftragsverarbeiter, inklusive der Cloud-Regionen, in denen Ihre Daten verarbeitet werden, und wer bei Änderungen informiert wird.
  3. Aufbewahrung: Zero Data Retention für sensible Workloads oder ein definiertes Maximum (z. B. 30 Tage zur Missbrauchsüberwachung).
  4. SLA und Rate Limits: Verfügbarkeit, garantierter Durchsatz für Ihre Lastspitze und was bei Überlastung passiert.
  5. Frist für die Abkündigung von Modellen: wie lange eine von Ihnen validierte Modellversion verfügbar bleibt — verlangen Sie für Produktiv-Workloads mindestens sechs Monate.
  6. Schutz vor Preisänderungen für zugesagtes Volumen und das Recht, zugesagtes Volumen auf neuere Modelle zu übertragen.
  7. IP-Freistellung für generierte Ergebnisse und klares Eigentum an Ergebnissen und feinabgestimmten Artefakten.
  8. Sicherheits- und Vorfallregelungen: Zertifizierungen, Penetrationstests, Meldung von Datenpannen innerhalb fester Stunden.
  9. Mitwirkung beim EU AI Act: die Dokumentation, die Sie als Betreiber brauchen, und wie der Anbieter Transparenz und die Kennzeichnungspflicht ab 2. Dezember 2026 unterstützt — siehe unseren Leitfaden zum EU AI Act.
  10. Exit: Export von Unterhaltungen, Dateien und Konfigurationen sowie bestätigte Löschung zum Vertragsende.

Ein Anbieter oder mehrere?

Für Mitarbeiter-Assistenten gilt: standardisieren. Zwei konkurrierende Chat-Tools verdoppeln Schulungs-, Lizenz- und Governance-Kosten und verwirren die Nutzer. Für API-Workloads gilt das Gegenteil: Halten Sie mindestens zwei Anbieter qualifiziert. Ein primäres Modell übernimmt den Großteil des Traffics, ein zweites ist auf demselben Evaluationsset getestet und bereit zu übernehmen, wenn sich Preise, Qualität oder Verfügbarkeit ändern — oder die Aufgaben zu erledigen, bei denen es schlicht besser ist.

Drei Architekturentscheidungen halten diese Flexibilität günstig: ein schlankes Gateway vor allen Modellaufrufen (Logging, Routing, Kostenkontrolle), MCP-basierte Integrationen statt anbieterspezifischer Plugins und ein portables Evaluationsset, das Sie bei jedem neuen Modell erneut laufen lassen. Damit ist ein Modellwechsel eine Konfigurationsänderung, kein Projekt.

Ein 30-Tage-Auswahlprozess

WocheWas passiertErgebnis
13–5 Anwendungsfälle wählen, Gewichtungen mit IT, Sicherheit, Recht und Fachbereich abstimmen, 2–3 Anbieter in die engere Wahl nehmenGewichtete Scorecard und Shortlist
2–350–100 echte Aufgaben pro Anbieter, Blindbewertung durch Fachleute, Tokens und Latenz pro Aufgabe messenErgebnisse zu Qualität und Kosten pro Aufgabe
3Sicherheitsfragebogen, AVV-Prüfung, Datenflussdiagramm, Berechtigungsmodell für AgentenFreigabe durch Sicherheit und Compliance
4Preise, zugesagtes Volumen und die obigen Klauseln verhandeln; Haupt- und Ersatzanbieter festlegenUnterschriebener Vertrag und Rollout-Plan

Fazit

2026 ist jeder seriöse KI-Anbieter für die meisten Geschäftsaufgaben gut genug, und die führenden kosten pro Token gleich viel. In der Beschaffung gewinnen nicht die Unternehmen, die das „beste" Modell wählen, sondern jene, die bewusst wählen: klare Gewichtungen, Tests mit eigenen Daten, Verträge, die sie schützen, wenn sich der Markt bewegt, und eine Architektur, die einen Wechsel erlaubt. Für die meisten Unternehmen in der DACH-Region und in Kroatien heißt das: ein Hauptanbieter — sehr oft Claude oder GPT, Gemini für Workspace-Unternehmen und Mistral, wo Souveränität dominiert — plus ein qualifizierter Zweitanbieter und Spezialwerkzeuge wie Manus dort, wo sie sich ihren Platz verdienen.

Sie wählen einen KI-Anbieter für Ihr Unternehmen?

Wir führen anbieterneutrale KI-Auswahlverfahren für Unternehmen in der DACH-Region und in Kroatien durch: Definition der Anwendungsfälle, Evaluationssets in Ihren Sprachen, Blindbewertung, Sicherheits- und Vertragsprüfung und ein Rollout-Plan. Als Claude Certified Architect aus Zagreb arbeiten wir täglich produktiv mit Claude, GPT, Gemini und Mistral.

Mit einem KI-Berater sprechen