Boris Agatić · · 9 Min. Lesezeit

Deep-Research-KI-Agenten 2026: Wie ChatGPT, Claude, Mistral & Manus für Ihr Unternehmen recherchieren

Von allen agentischen KI-Funktionen seit 2025 ist eine still und leise zum täglichen Werkzeug von Analysten, Beratern, Juristen und Produktteams geworden: Deep Research. Sie stellen eine Frage, der Agent plant eine Strategie, führt Dutzende oder Hunderte Suchen durch, liest die Quellen und liefert einen strukturierten Bericht mit Quellenangaben — in Minuten statt Tagen. Inzwischen hat jedes große KI-Labor ein solches Tool: OpenAI, Anthropic, Google, Mistral, Perplexity und Manus. Dieser Leitfaden erklärt, wie Deep-Research-Agenten funktionieren, was die Benchmarks zeigen, was sie wirklich kosten, wo sie scheitern und wie man sie im Unternehmen sicher einsetzt.

Von der Chatbot-Antwort zum Recherchebericht

Eine normale Chatbot-Antwort entsteht in einem Durchgang: Das Modell liest die Frage, führt vielleicht ein oder zwei Suchen durch und schreibt. Ein Deep-Research-Agent arbeitet in einer Schleife. Er zerlegt die Frage in Teilfragen, sucht, liest, erkennt Lücken oder Widersprüche, sucht erneut und schreibt erst dann einen Bericht — meist mehrere Seiten lang, mit Quellenverzeichnis. Der Ansatz verbindet drei Fähigkeiten, die gemeinsam gereift sind: Reasoning-Modelle, die planen und reflektieren können, zuverlässige Tool-Nutzung zum Browsen und Lesen von Dateien sowie lange Kontextfenster, die Dutzende Dokumente gleichzeitig fassen.

Google brachte die erste breit verfügbare Version im Dezember 2024 als Gemini Deep Research. OpenAI Deep Research folgte im Februar 2025, basierend auf einer speziell fürs Browsen trainierten Version von o3, und setzte schnell den Maßstab. Perplexity startete im selben Monat, Anthropic ergänzte Claude im April 2025 um Research, Mistral fügte Le Chat im Juli 2025 einen Deep-Research-Modus hinzu, und Manus führte „Wide Research" ein, das eine Aufgabe auf viele parallele Agenten verteilt.

51,5 %
BrowseComp-Genauigkeit von OpenAI Deep Research vs. 1,9 % für GPT-4o mit Browsing
+90 %
bessere Ergebnisse von Anthropics Multi-Agenten-System vs. einem einzelnen Agenten (interne Evaluierung)
~15×
mehr Tokens verbraucht Multi-Agenten-Recherche als ein normaler Chat (Anthropic)

Was die Benchmarks zeigen

Zwei Benchmarks sind für die Bewertung von Recherche-Agenten besonders nützlich. BrowseComp, im April 2025 von OpenAI veröffentlicht, enthält 1.266 Fragen, deren Antworten schwer zu finden, aber leicht zu überprüfen sind — genau die Art, die hartnäckiges Browsen über viele Seiten erfordert. Der Abstand zwischen normalen Modellen und trainierten Recherche-Agenten ist enorm:

BrowseComp-Genauigkeit (%) — schwer auffindbare Web-Fakten (OpenAI, April 2025)

Der zweite ist Humanity's Last Exam (HLE) mit über 2.500 Fragen auf Expertenniveau aus Dutzenden Fachgebieten. Zum Start erreichte OpenAI Deep Research 26,6 % und Perplexity Deep Research 21,1 %, während die meisten damaligen Standardmodelle im einstelligen Bereich lagen. Frontier-Modelle aus 2026 erzielen deutlich mehr, doch die Lehre der frühen Zahlen bleibt: Suche plus Iteration schlägt reines Modellwissen bei schwierigen Faktenfragen.

Genauigkeit auf Humanity's Last Exam (%) — Ergebnisse Anfang 2025

Die wichtigsten Tools im Vergleich

ToolStärkenIdeal für
ChatGPT Deep Research (OpenAI)Hartnäckiges Browsen, stark bei schwer auffindbaren Fakten, Datei- und Connector-Unterstützung, per API verfügbarMarkt- und Wettbewerbsscans, Faktenrecherche, technische Recherche
Claude Research (Anthropic)Multi-Agenten-Design mit parallelen Subagenten, kombiniert Web mit Google Workspace und per MCP angebundenen UnternehmenstoolsRecherchen, die öffentliches Web und interne Dokumente verbinden, lange strukturierte Berichte
Gemini Deep Research (Google)Bearbeitbarer Rechercheplan, Tiefe der Google-Suche, Workspace-IntegrationTeams in Google Workspace, breite Überblicke
Le Chat Deep Research (Mistral)Europäischer Anbieter, Enterprise- und On-Premise-Optionen, mehrsprachigOrganisationen mit Anforderungen an EU-Datenresidenz oder Souveränität
Manus Wide ResearchViele Allzweck-Agenten parallel, jeder bearbeitet einen Eintrag einer großen ListeAufgaben wie „recherchiere 100 Unternehmen/Produkte", Lead-Listen, Vergleiche
Perplexity Deep ResearchSchnelle, quellenorientierte Antworten, günstiger PreisKurze Briefings mit sichtbaren Quellen

Die Unterschiede zwischen den Top-Tools sind kleiner als die Unterschiede zwischen den Aufgaben. Bewährt hat sich, eine wichtige Frage durch zwei Tools laufen zu lassen und zu vergleichen — genau dort, wo sie sich widersprechen, sollte ein Mensch hinschauen.

Warum Multi-Agenten-Recherche funktioniert — und warum sie mehr kostet

Anthropic hat ausführlich beschrieben, wie Claude Research aufgebaut ist: Ein Lead-Agent plant die Recherche und startet mehrere Subagenten, die parallel suchen, jeder mit eigenem Kontextfenster; ein separater Schritt prüft die Quellenangaben. In Anthropics interner Recherche-Evaluierung übertraf dieses Multi-Agenten-System einen einzelnen Agenten um 90,2 %. Der Hauptgrund ist einfach: mehr Reasoning und Suche insgesamt, verteilt auf parallele Worker. Dieselbe Analyse ergab, dass allein der Token-Verbrauch etwa 80 % der Leistungsunterschiede erklärt.

Die Kehrseite sind die Kosten. Agenten verbrauchen etwa 4-mal so viele Tokens wie Chat-Interaktionen, Multi-Agenten-Systeme etwa 15-mal so viele. Deshalb begrenzen Endkundentarife die Zahl der Deep-Research-Durchläufe pro Monat, und API-basierte Pipelines brauchen Budgets, Tiefenlimits und Abbruchregeln. Unser Leitfaden zu KI-Inferenzkosten zeigt, wie man diese Zahlen im Griff behält.

Relativer Token-Verbrauch pro Aufgabe — Chat vs. Agent vs. Multi-Agenten-Recherche (Anthropic)

Anwendungsfälle, die sich lohnen

Zeit für einen 10-seitigen Marktüberblick — Analyst vs. Deep-Research-Workflow (illustrativ, Stunden)

Die Zeitersparnis im Diagramm stammt vor allem aus den Phasen Sammeln und Erstentwurf. Prüfung und Urteil bleiben menschlich — und sollten mehr Aufmerksamkeit bekommen, nicht weniger, weil der Entwurf jetzt so schnell kommt.

Wo Deep-Research-Agenten scheitern

Faustregel: Behandeln Sie einen Deep-Research-Bericht wie die Arbeit eines schnellen, belesenen Junior-Analysten. Er ist ein hervorragender Erstentwurf mit Quellenliste — aber keine endgültige Antwort. Prüfen Sie die drei bis fünf Aussagen, von denen Ihre Entscheidung wirklich abhängt.

So erhalten Sie bessere Rechercheberichte

  1. Schreiben Sie ein echtes Briefing. Nennen Sie Ziel, zugrunde liegende Entscheidung, Zielgruppe, Zeitraum, Region und Ausgabeformat — wie für einen menschlichen Analysten.
  2. Legen Sie Quellen fest. Nennen Sie bevorzugte Quellen (amtliche Statistik, Aufsichtsbehörden, Unternehmensberichte) und solche, die zu meiden sind.
  3. Fordern Sie Trennung. Verlangen Sie eine klare Aufteilung in belegte Fakten mit Quellen, Schätzungen und die eigene Interpretation des Agenten.
  4. Iterieren Sie. Prüfen Sie den Plan, falls das Tool ihn anzeigt, und schließen Sie Lücken mit Nachfragen, statt neu zu beginnen.
  5. Standardisieren Sie. Machen Sie wiederkehrende Recherchen — monatliche Wettbewerbsscans, Lieferantenprüfungen — zu Vorlagen oder geplanten Agenten-Aufgaben mit fester Struktur.

Fazit

Deep-Research-Agenten sind eines der klarsten Beispiele dafür, dass agentische KI schon heute Mehrwert liefert: Sie verdichten Stunden an Recherche auf Minuten und machen Fragen recherchierbar, für die früher keine Zeit war. Die Tools von OpenAI, Anthropic, Google, Mistral und Manus unterscheiden sich vor allem bei Datenzugang, Compliance und Stil — nicht darin, ob sie funktionieren. Unternehmen, die am meisten herausholen, schreiben gute Briefings, binden die richtigen internen Quellen an, planen die Token-Kosten ein und lassen einen Menschen verantwortlich prüfen, was wirklich zählt.

Recherche-Agenten auf Ihren Daten?

Wir unterstützen Unternehmen in Kroatien und im DACH-Raum beim Aufbau von Deep-Research-Workflows — von der Tool-Auswahl und Recherchevorlagen über die Anbindung interner Quellen per MCP bis zu geprüften, automatisierten Recherche-Pipelines auf Basis von Claude. Als Claude Certified Architect aus Zagreb machen wir KI-Recherche zuverlässig genug für echte Entscheidungen.

Sprechen Sie mit einem KI-Berater