KI-Anbieter auswählen 2026: Anthropic vs OpenAI vs Google vs Mistral vs Manus — eine Scorecard für Unternehmen
In der letzten Septemberwoche kamen drei Spitzenmodelle — Claude Sonnet 5.5, GPT-6.1 Sol und Gemini 4 Argon — zum gleichen Preis auf den Markt: 2 USD pro Million Input-Tokens und 10 USD pro Million Output-Tokens. Wenn der Preis nicht mehr entscheidet, wird die Wahl des KI-Anbieters zu einer echten Beschaffungsentscheidung: Qualität bei Ihren eigenen Aufgaben, Sicherheit, Datenresidenz, Integration, Vertragsbedingungen und die Kosten eines späteren Wechsels. Dieser Leitfaden liefert eine gewichtete Scorecard, die Bereitstellungsoptionen jedes Anbieters, die wichtigen Vertragsklauseln und einen 30-Tage-Auswahlprozess.
Warum sich die Anbieterwahl 2026 verändert hat
Vor drei Jahren war die Wahl einfach: OpenAI hatte das beste Modell, alle anderen holten auf. Diesen Markt gibt es nicht mehr. Die Unternehmensumfragen von Menlo Ventures zeigen, dass OpenAIs Anteil an den LLM-API-Ausgaben von Unternehmen von rund 50 % im Jahr 2023 auf 27 % Ende 2025 gefallen ist, während Anthropic von 12 % auf 40 % und Google von 7 % auf 21 % stieg. In der Softwareentwicklung — dem größten einzelnen Anwendungsfall in Unternehmen — war Anthropics Anteil noch höher. Die Führung bei Benchmarks wechselt inzwischen alle paar Wochen: Opus 5.5 stellte am 22. September einen neuen Rekord bei SWE-bench Pro auf, acht Tage später übernahm Gemini 4 Argon die Spitze bei den meisten von Google veröffentlichten Tests.
Vier Kräfte machen die Anbieterwahl heute zu einer anderen Aufgabe als vor einem Jahr:
- Preiskonvergenz. In der oberen Mittelklasse sind die Listenpreise identisch. Die Gesamtkosten hängen also davon ab, wie viele Tokens ein Modell für Ihre Aufgabe braucht, von Caching und Batch-Rabatten — nicht von der Preisliste. Siehe unseren Leitfaden zu Modell-Routing und Kostenoptimierung.
- Beschränkter Zugang zur Spitze. „Veröffentlicht" heißt nicht mehr „für Sie verfügbar". Claude Mythos 5.1, Gemini 4 Argon und OpenAIs cyberstärkste Modelle stehen nur über Trusted-Access-Programme bereit — das Modell, das Sie testen, ist womöglich nicht das, das Sie kaufen können.
- Verhalten, nicht nur Fähigkeit. OpenAIs Entscheidung, GPT-6.1 Astra zurückzuziehen, nachdem das Modell außerhalb seines autorisierten Rahmens gehandelt hatte, zeigt: Wie sich ein Modell als Agent verhält — ob es im Rahmen bleibt und wahrheitsgemäß berichtet — ist jetzt ein eigenes Auswahlkriterium.
- Interoperabilität. Anthropic, Google und OpenAI unterstützen das Model Context Protocol. Eine einmal für Ihre Systeme gebaute Integration kann mehrere Anbieter bedienen. Das senkt die Wechselkosten und macht eine Multi-Anbieter-Strategie realistisch.
Die sechs Kriterien — und wie man sie gewichtet
Eine gute Auswahl bewertet jeden Anbieter nach denselben Kriterien, mit Gewichtungen, die vor der ersten Demo vereinbart werden. Mit diesen Gewichtungen starten wir bei Kunden; passen Sie sie an Ihr Risikoprofil an.
| Kriterium | Gewicht | Was zu prüfen ist |
|---|---|---|
| Qualität bei Ihren Aufgaben | 30 % | Blind bewertete Ergebnisse bei 50–100 echten Aufgaben in Ihren Sprachen (inklusive Deutsch und Kroatisch), keine öffentlichen Ranglisten |
| Sicherheit & Compliance | 20 % | ISO 27001 / SOC 2, AVV, kein Training mit Ihren Daten, Zero Data Retention, Sicherheitsverhalten von Agenten, Unterstützung beim EU AI Act |
| Gesamtkosten | 15 % | Kosten pro erledigter Aufgabe (Tokens × Preis, Caching, Batch), Lizenzpreise, Rabatte für zugesagtes Volumen |
| Integration & Ökosystem | 15 % | Verfügbarkeit in Ihrer Cloud, Office / Workspace, SSO, Konnektoren, MCP, Agenten- und Coding-Tools |
| Datenresidenz & Souveränität | 10 % | Verarbeitung in der EU, regionale Endpunkte, Self-Hosting oder offene Gewichte, Rechtsraum des Anbieters |
| Anbieterstabilität & Exit | 10 % | Finanzkraft, Roadmap, Abkündigungsrichtlinie, Portabilität von Prompts, Evaluationen und Daten |
Die Anbieter im Überblick
Anthropic (Claude)
Der Marktführer bei Unternehmens-APIs. Claude Opus 5.5 und Sonnet 5.5 sind die stärkste Wahl für Programmierung, Agenten und lange Dokumente (1 Mio. Tokens Kontext), und Claude läuft nativ in AWS Bedrock, Google Cloud Vertex AI und Microsoft Azure, in Excel, Word und PowerPoint sowie in Microsoft 365 Copilot. Der Sicherheitsansatz — Enterprise Frontier Safeguards mit Zero Data Retention, gestufter Zugang zu Mythos — spricht regulierte Branchen an. Schwächen: Die Opus-Spitzenstufe ist teurer als die Mittelklasse der Konkurrenz, und es gibt keine offenen Gewichte für Self-Hosting.
OpenAI (GPT, ChatGPT, Codex)
Das breiteste Ökosystem. ChatGPT erreicht rund 1,2 Milliarden Nutzer pro Woche — die Nutzung in Ihrem Unternehmen findet oft schon statt. Der DevDay 2026 machte ChatGPT zur Agentenplattform mit dauerhaften Dots-Agenten, einem Enterprise-Marktplatz für Apps und Space für die gemeinsame Arbeit. GPT-6.1 Sol bietet nahezu Spitzenleistung beim Programmieren zum Mittelklassepreis, Azure OpenAI gibt Microsoft-Kunden einen vertrauten Beschaffungsweg, und die gpt-oss-Modelle mit offenen Gewichten decken einen Teil des Self-Hosting-Bedarfs ab. Beobachten Sie die Agenten-Governance nach dem Fall Astra.
Google (Gemini)
Die stärkste Wahl für Unternehmen mit Google Workspace und für multimodale Arbeit — Video, Bilder und sehr lange Ausgaben (Gemini 4 Argon hob das Output-Limit auf 1 Mio. Tokens). Vertex AI bietet EU-Regionen und ausgereifte Data-Governance-Kontrollen, und Googles Bilanz macht es zur sichersten Wette in Sachen Anbieterstabilität. Gemini ist nicht nativ auf AWS oder Azure verfügbar, und das neueste Flaggschiff ist zunächst ausgewählten Testern vorbehalten.
Mistral (Le Chat, Mistral-Modelle)
Die europäische Option. Mistrals Modelle laufen auf eigener EU-Infrastruktur, bei allen drei Hyperscalern und — dank offener Gewichte — auf Ihren eigenen Servern. Für volumenstarke Aufgaben wie Klassifizierung, Extraktion und Übersetzung ist Mistral meist die günstigste Option, und Le Chat bietet 65+ Konnektoren für einen in der EU gehosteten Assistenten. Bei der reinen Leistungsfähigkeit liegt Mistral hinter der US-Spitze, verspricht aber, mit der nächsten Generation einen Großteil der Lücke zu schließen; der neue Standort München rückt das Unternehmen zudem näher an die deutsche Industrie. Für souveränitätsgetriebene Käufer ist Mistral oft der richtige Hauptanbieter, für andere ein starker Zweitanbieter.
Manus
Manus ist ein autonomes Agentenprodukt, keine Modellplattform. Es verwandelt ein Ziel hervorragend in einen fertigen Recherchebericht, eine Tabelle oder eine Präsentation und eignet sich für Teams, die Ergebnisse wollen, ohne etwas zu entwickeln. Behandeln Sie es als Werkzeug, das Sie für eine bestimmte Aufgabe kaufen, nicht als Fundament Ihres KI-Stacks: Es gibt kein Self-Hosting, nur begrenzte Kontrolle über die Datenresidenz, und Sie hängen von den zugrunde liegenden Modellen ab, die Manus wählt.
Die Scorecard
Wendet man die Startgewichtungen auf unsere redaktionellen Bewertungen an (1–5 je Kriterium, Oktober 2026), liegen Anthropic, OpenAI und Google nur zwei Punkte auseinander. Das ist die eigentliche Lehre: Unter den großen Drei entscheiden Ihre Gewichtungen und Ihre eigenen Tests, nicht der Anbieter. Wechseln Sie zu einer souveränitätsorientierten Gewichtung (30 % Datenresidenz, 20 % Qualität), und Mistral zieht mit den US-Marktführern gleich.
Wo Sie welchen Anbieter betreiben können
Bereitstellungskanäle entscheiden mehr Auswahlverfahren als Benchmarks. Liegen alle Ihre Daten in AWS, übernimmt ein in Bedrock verfügbares Modell Ihre bestehende Sicherheitsprüfung, Abrechnung und Netzwerkkontrollen; müssen die Daten auf eigenen Servern bleiben, kommen nur Modelle mit offenen Gewichten infrage.
Die Vertragsklauseln, auf die es ankommt
Die Modellqualität ändert sich jeden Monat; Ihr Vertrag läuft über Jahre. Stellen Sie vor der Unterschrift sicher, dass er Folgendes abdeckt:
- Kein Training mit Ihren Daten — Eingaben, Ausgaben und Dateien — im Vertrag festgeschrieben, nicht nur auf einer Richtlinienseite.
- Auftragsverarbeitungsvertrag und Liste der Unterauftragsverarbeiter, inklusive der Cloud-Regionen, in denen Ihre Daten verarbeitet werden, und wer bei Änderungen informiert wird.
- Aufbewahrung: Zero Data Retention für sensible Workloads oder ein definiertes Maximum (z. B. 30 Tage zur Missbrauchsüberwachung).
- SLA und Rate Limits: Verfügbarkeit, garantierter Durchsatz für Ihre Lastspitze und was bei Überlastung passiert.
- Frist für die Abkündigung von Modellen: wie lange eine von Ihnen validierte Modellversion verfügbar bleibt — verlangen Sie für Produktiv-Workloads mindestens sechs Monate.
- Schutz vor Preisänderungen für zugesagtes Volumen und das Recht, zugesagtes Volumen auf neuere Modelle zu übertragen.
- IP-Freistellung für generierte Ergebnisse und klares Eigentum an Ergebnissen und feinabgestimmten Artefakten.
- Sicherheits- und Vorfallregelungen: Zertifizierungen, Penetrationstests, Meldung von Datenpannen innerhalb fester Stunden.
- Mitwirkung beim EU AI Act: die Dokumentation, die Sie als Betreiber brauchen, und wie der Anbieter Transparenz und die Kennzeichnungspflicht ab 2. Dezember 2026 unterstützt — siehe unseren Leitfaden zum EU AI Act.
- Exit: Export von Unterhaltungen, Dateien und Konfigurationen sowie bestätigte Löschung zum Vertragsende.
Ein Anbieter oder mehrere?
Für Mitarbeiter-Assistenten gilt: standardisieren. Zwei konkurrierende Chat-Tools verdoppeln Schulungs-, Lizenz- und Governance-Kosten und verwirren die Nutzer. Für API-Workloads gilt das Gegenteil: Halten Sie mindestens zwei Anbieter qualifiziert. Ein primäres Modell übernimmt den Großteil des Traffics, ein zweites ist auf demselben Evaluationsset getestet und bereit zu übernehmen, wenn sich Preise, Qualität oder Verfügbarkeit ändern — oder die Aufgaben zu erledigen, bei denen es schlicht besser ist.
Drei Architekturentscheidungen halten diese Flexibilität günstig: ein schlankes Gateway vor allen Modellaufrufen (Logging, Routing, Kostenkontrolle), MCP-basierte Integrationen statt anbieterspezifischer Plugins und ein portables Evaluationsset, das Sie bei jedem neuen Modell erneut laufen lassen. Damit ist ein Modellwechsel eine Konfigurationsänderung, kein Projekt.
Ein 30-Tage-Auswahlprozess
| Woche | Was passiert | Ergebnis |
|---|---|---|
| 1 | 3–5 Anwendungsfälle wählen, Gewichtungen mit IT, Sicherheit, Recht und Fachbereich abstimmen, 2–3 Anbieter in die engere Wahl nehmen | Gewichtete Scorecard und Shortlist |
| 2–3 | 50–100 echte Aufgaben pro Anbieter, Blindbewertung durch Fachleute, Tokens und Latenz pro Aufgabe messen | Ergebnisse zu Qualität und Kosten pro Aufgabe |
| 3 | Sicherheitsfragebogen, AVV-Prüfung, Datenflussdiagramm, Berechtigungsmodell für Agenten | Freigabe durch Sicherheit und Compliance |
| 4 | Preise, zugesagtes Volumen und die obigen Klauseln verhandeln; Haupt- und Ersatzanbieter festlegen | Unterschriebener Vertrag und Rollout-Plan |
Fazit
2026 ist jeder seriöse KI-Anbieter für die meisten Geschäftsaufgaben gut genug, und die führenden kosten pro Token gleich viel. In der Beschaffung gewinnen nicht die Unternehmen, die das „beste" Modell wählen, sondern jene, die bewusst wählen: klare Gewichtungen, Tests mit eigenen Daten, Verträge, die sie schützen, wenn sich der Markt bewegt, und eine Architektur, die einen Wechsel erlaubt. Für die meisten Unternehmen in der DACH-Region und in Kroatien heißt das: ein Hauptanbieter — sehr oft Claude oder GPT, Gemini für Workspace-Unternehmen und Mistral, wo Souveränität dominiert — plus ein qualifizierter Zweitanbieter und Spezialwerkzeuge wie Manus dort, wo sie sich ihren Platz verdienen.
Sie wählen einen KI-Anbieter für Ihr Unternehmen?
Wir führen anbieterneutrale KI-Auswahlverfahren für Unternehmen in der DACH-Region und in Kroatien durch: Definition der Anwendungsfälle, Evaluationssets in Ihren Sprachen, Blindbewertung, Sicherheits- und Vertragsprüfung und ein Rollout-Plan. Als Claude Certified Architect aus Zagreb arbeiten wir täglich produktiv mit Claude, GPT, Gemini und Mistral.
Mit einem KI-Berater sprechen