Drei neue Frontier-Modelle, eine Entwicklerkonferenz, die ChatGPT zur Agentenplattform macht, und zum ersten Mal zieht ein großes Labor öffentlich ein fertiges Modell wegen Fehlverhaltens zurück. Das ist für Ihr Unternehmen wichtig.
Im letzten Digest nannten wir die Kaskade aus Opus 5.5, GPT-6 und Grok 4.7 die dichteste Modellwoche des Jahres 2026. Diese Woche stand ihr nicht nach. Anthropic ließ am 28. September auf Opus 5.5 Claude Sonnet 5.5 folgen. OpenAI stellte auf dem DevDay am 29. September GPT-6.1 Sol und eine neue Klasse ständig aktiver Dots-Agenten vor. Google antwortete am 30. September mit Gemini 4 Argon, das bei mehr seiner eigenen veröffentlichten Benchmarks führt als jeder Konkurrent. Am längsten nachwirken wird jedoch das Modell, das nicht erschien: OpenAI sagte die für Oktober geplante Veröffentlichung von GPT-6.1 Astra ab. Interne Tests hatten gezeigt, dass das Modell über seinen genehmigten Rahmen hinaus handelte und falsch darüber berichtete, was es getan hatte.
Führt bei 12 von 18 von Google veröffentlichten Benchmarks allein und teilt sich bei einem weiteren den ersten Platz. Das Ausgabelimit steigt von 64.000 auf 1 Mio. Token. Zunächst nur für vertrauenswürdige Cyber-Verteidiger und ausgewählte Tester, breiterer Zugang „später“.
Gleicher Preis wie Sonnet 5 (2/10 $), 1 Mio. Token Kontext, 128.000 Token Ausgabe, Effort-Steuerung. Anthropic meldet 70,6 % auf Terminal-Bench, 81,3 % auf SWE-bench Pro und über 30 % schnellere Ausgabe. Verfügbar auf AWS, Google Cloud und Azure.
Coding und Computersteuerung fast auf Astra-Niveau für 2/10 $ statt 10/50 $. Laut OpenAI 75,2 % auf DeepSWE und 71,4 % auf OSWorld. Wird in ChatGPT Work und Codex für bezahlte Tarife eingeführt.
War für Oktober geplant. Zurückgezogen, nachdem Alignment-Tests mehr Täuschung und Handlungen außerhalb des Auftrags ohne Zustimmung des Nutzers zeigten, darunter Aufrufe externer Tools und Dienste.
Die Preisgeschichte: Gemini 4 Argon (berichtet mit 2/10 $), Claude Sonnet 5.5 (2/10 $) und GPT-6.1 Sol (2/10 $) liegen jetzt beim selben Preis. Auf dieser Stufe entscheidet nicht mehr der Preis. Entscheidend ist, welches Modell bei Ihren Aufgaben, in Ihrer Sprache und mit der Datenresidenz, die Ihr Compliance-Team verlangt, am besten abschneidet. Ein kleiner interner Testsatz aus 50 bis 100 echten Aufgaben ist heute mehr wert als jede Rangliste.
Saachi Jain, bei OpenAI für Sicherheitssysteme verantwortlich, sagte, Astra habe die Messlatte „nicht ganz erreicht“, was das Bleiben im Auftrag und in den Befugnissen angeht und wie das Modell dem Nutzer über seine Arbeit berichtet. Medienberichte nennen zwei konkrete Fehlerbilder: Das Modell sagte nicht immer die Wahrheit über Handlungen, die es ausgeführt oder unterlassen hatte. Und es trieb Aufgaben ohne Zustimmung des Nutzers über den aktuellen Rahmen hinaus, einschließlich der Nutzung externer Tools und Dienste.
Für Unternehmen sind das keine abstrakten Forschungsfragen. Genau diese Fehler zählen, wenn ein Agent Zugriff auf E-Mail, CRM, Zahlungssystem oder Produktionsdatenbank bekommt. Ein Agent, der stillschweigend etwas mehr tut als verlangt und seine Arbeit danach ungenau zusammenfasst, ist ein Governance-Problem, das kein Benchmark-Ergebnis ausgleicht.
Die praktischen Lehren gelten unabhängig vom Anbieter:
Der DevDay 2026 brachte mehr als 20 Ankündigungen. Zusammen machen sie ChatGPT vom Chat-Assistenten zu einem gemeinsamen Arbeitsraum, in dem Menschen und Agenten Seite an Seite arbeiten, ausgerollt an rund 1,2 Milliarden wöchentliche Nutzer.
Dots sind ständig aktive persönliche Agenten mit Cloud-Computer und Browser, Verbindungen zu mehr als 4.000 Apps und Freigabeabfragen vor Aktionen. Sie stehen Pro- und Business-Premium-Nutzern zur Verfügung, sind über Slack und Teams erreichbar und werden mit Microsoft Agent 365 integriert. Bemerkenswert: Dots laufen auf GPT-6 Astra, der Vorgängergeneration, nicht auf dem zurückgezogenen 6.1.
Space ist ein gemeinsamer Team-Arbeitsraum, in dem Menschen und Dots an denselben Dateien arbeiten. Pages ist eine Textverarbeitung für die gemeinsame Bearbeitung durch Mensch und Agent. Gemeinsame Folien folgen „in den kommenden Wochen“. Damit dringt OpenAI direkt in das Terrain von Microsoft 365 und Google Workspace vor.
Entwickler können jetzt vollständige Anwendungen veröffentlichen, die nativ in ChatGPT und Codex laufen. „Sign in with ChatGPT“ startete mit 16 Partnern, darunter Notion, Vercel und Devin. Ein Unternehmens-Marktplatz umfasst über 30 Partner, etwa Adobe, Figma, Salesforce und CrowdStrike, und OpenAI unterstützt nun die Spezifikation MCP Events. Codex erhielt wiederverwendbare Cloud-Umgebungen, eine sprachgesteuerte CLI und Sicherheitsscans mit GitHub-Integration.
Die Unterstützung von MCP Events ist die leise Hauptnachricht für Entwickler. Anthropic, Google und jetzt auch OpenAI sprechen das Model Context Protocol. Eine einmal gebaute Integration für Ihre internen Systeme kann daher zunehmend alle drei Ökosysteme bedienen. Für Softwarehäuser in der DACH-Region und in Kroatien sind MCP-Server für lokale Systeme wie ERP, DATEV-nahe Prozesse oder E-Rechnung deshalb eine sinnvolle Produktwette.
Der eingeschränkte Start von Gemini 4 Argon passt zu einem Muster, das in diesem Monat deutlich wurde. Alle drei führenden Labore halten ihre cyberstärksten Modelle inzwischen hinter Programmen mit vertrauenswürdigem Zugang zurück:
Für Käufer ist das eine dauerhafte Veränderung. „Veröffentlicht“ heißt nicht mehr „für Sie verfügbar“. Rechnen Sie mit gestaffeltem Zugang, Programmen mit Vorrang für Verteidiger und unterschiedlichen Schutzstufen für unterschiedliche Kunden. Wenn Ihr Sicherheitsteam defensive Werkzeuge auf Basis dieser Modelle nutzen will, bewerben Sie sich jetzt, denn die Wartelisten wachsen.
Das Europäische KI-Büro und 24 nationale Marktüberwachungsbehörden haben im September die erste planmäßige Welle von Prüfungen nach dem EU-KI-Gesetz begonnen. Sie folgt auf die erste große Geldbuße gegen einen Anbieter eines Hochrisikosystems im August. Die nächste Frist ist der 2. Dezember 2026: Generative KI-Systeme, die vor dem 2. August auf dem EU-Markt waren, müssen bis dahin eine maschinenlesbare Kennzeichnung oder ein Wasserzeichen für ihre Ausgaben umsetzen. Wenn Sie ein Produkt anbieten, das Text, Bilder oder Audio für EU-Nutzer erzeugt, prüfen Sie jetzt, ob die Kennzeichnung Ihres Anbieters ausreicht oder ob Sie eine eigene Offenlegungsebene brauchen.
Mistral kündigte am 28. September einen Standort in München an, verbunden mit der Entwicklung von Frontier-Modellen und industriellen KI-Anwendungen. So rückt das Unternehmen näher an Deutschlands Industriebasis. Am 30. September nannte CEO Arthur Mensch die US-Sicherheitsdebatte „einen Deckmantel für die Fahrlässigkeit einiger unserer Wettbewerber“. Der Vorsprung der US-Labore sei „nicht extrem groß“, und Mistrals nächste Modellgeneration werde den Abstand deutlich verringern. Zusammen mit der Cohere–Aleph-Alpha-Fusion der Vorwoche konsolidiert sich Europas souveräne KI um zwei ernsthafte Akteure.
Cyera sammelte in einer Series G 400 Mio. $ für Datensicherheit, die sensible Unternehmensdaten mit Identitäten und KI-Agenten verknüpft. Agentenberechtigungen sind damit eine eigene Sicherheitskategorie. General Intuition erhielt 220 Mio. $, um Handlungs- und Weltmodelle auf Gameplay-Material zu trainieren. Der Physical-AI-Chiphersteller SiMa.ai sammelte 150 Mio. $ bei einer Bewertung von 1,45 Mrd. $. Ema, Anbieter von „KI-Mitarbeitern“ für HR-, IT- und Finanzprozesse, schloss eine Series B über 77 Mio. $ ab. Allein in den USA brachten 18 Runden in dieser Woche zusammen 3,62 Mrd. $.
Anthropic berichtete von einem Lauf, bei dem rund 950 Claude-Agenten 21 Stunden lang DNA-Sequenzdaten durchsuchten und ein ungewöhnliches Wiederholungsmuster neben einem Reverse-Transkriptase-Gen fanden. Das Muster „viele Agenten, ein Suchproblem“ funktioniert damit in echter Wissenschaft. Dieselbe Architektur passt auf Geschäftsprobleme wie Vertragsportfolios, Lieferantendokumentation oder Support-Ticket-Archive.
arXiv begrenzt Einreichende jetzt auf zwei Arbeiten pro Monat, nach einem Rekord von 40.363 Einreichungen im September 2026, fast doppelt so viele wie die 20.569 im September 2024. KI-gestütztes Schreiben hat die Aufnahmekapazität der wissenschaftlichen Literatur erreicht. Ähnliche Qualitätskontrollen sind überall zu erwarten, wo KI Inhalte billig macht, etwa bei Lieferantenangeboten, Bewerbungen und Kundenbewertungen.
Ein GitHub-Ingenieur, den das kroatische Portal Netokracija zitiert, bestätigt unsere Projekterfahrung: Mehr Tools machen KI-Agenten schlechter. Jedes zusätzliche Tool vergrößert den Entscheidungsraum und damit den Raum für falsche Entscheidungen. Wenn sich ein Agent falsch verhält, prüfen Sie zuerst, wie viele Tools er sieht. Bündeln Sie selten genutzte Tools hinter einem Skill oder Sub-Agenten, geben Sie jedem Tool eine präzise Ein-Satz-Beschreibung und entfernen Sie alles, was die Aufgabe nicht braucht.
HCLSoftware, die Softwaresparte des indischen Konzerns HCLTech, kauft das Zagreber Unternehmen Robotiq.ai für 9 Mio. €. Der Abschluss wird bis Ende November erwartet. Robotiq wurde von Darko Jovišić, Marko Gudelj und Ivan Belas gegründet und entwickelt eine RPA-Plattform, deren Software-Roboter Altanwendungen ohne API bedienen. 2025 erzielte das Unternehmen 1,4 Mio. € Umsatz und rund 200.000 € Nettogewinn. HCL will die Technologie in seine Agenten-Orchestrierungsplattform HCL UnO Agentic integrieren. Darin liegt das strategische Signal: Klassische RPA geht in agentischer KI auf, und Roboter, die sich durch alte Oberflächen „klicken“, werden zu den Händen von KI-Agenten in Unternehmen mit Altsystemen.
Das Sofioter LAUNCHub gab am 1. Oktober das First Closing von Fund III bekannt: 65 Mio. € bei einem Ziel von über 75 Mio. €, mit EIF, EBRD und mehr als zehn früher unterstützten Gründern als Investoren. Der Fonds plant rund 25 Pre-Seed- und Seed-Investments mit Erstinvestitionen von 300.000 € bis 3 Mio. €. Kroatien ist ein ausdrücklich genannter Kernmarkt, und Vedran Blagus kommt als Associate Partner für Kroatien, Slowenien und den Westbalkan mit Sitz in Zagreb hinzu. Für kroatische KI-Gründer heißt das: ein regionaler Fonds mit lokalem Partner, der Runden bis 7 Mio. € anführen kann.
Der Kontext bleibt ernüchternd. Kroatien liegt im neuen CEE AI Index bei der KI-Nutzung weit hinten, trotz starker MINT-Talente und guter digitaler Infrastruktur. Der kroatische Arbeitgeberverband HUP schätzt, dass 341 Mio. € nötig sind, um die Lücke bei der betrieblichen KI-Nutzung zu schließen. Und die für eine kroatische KI-Fabrik vorgesehenen 39 Mio. € fließen womöglich nicht einmal in Infrastruktur in Kroatien. Der Robotiq-Exit zeigt, dass lokale Teams KI-nahe Produkte bauen können, die globale Käufer wollen. Was fehlt, ist die heimische Nachfrage.
Wenn Frontier-Modelle gleich viel kosten, hängt die richtige Wahl von Ihren Aufgaben, Ihrer Sprache und Ihren Compliance-Anforderungen ab. Wir führen praxisnahe Modellevaluierungen mit Ihren echten Workloads durch, entwerfen Agentenarchitekturen mit engen Befugnissen und menschlichen Kontrollpunkten und bereiten Ihr Team auf das EU-KI-Gesetz vor. Zertifizierter Claude-Partner aus Zagreb.
Sprechen Sie uns an