Boris Agatić · · 9 min čitanja

Deep Research AI agenti 2026: kako ChatGPT, Claude, Mistral i Manus istražuju za vašu tvrtku

Od svih agentnih AI funkcija predstavljenih od 2025., jedna je tiho postala svakodnevni alat analitičara, konzultanata, pravnika i produktnih timova: deep research. Postavite pitanje, agent isplanira strategiju, pokrene desetke ili stotine pretraga, pročita izvore i vrati strukturirani izvještaj s citatima — za nekoliko minuta umjesto nekoliko dana. Danas ga ima svaki veliki laboratorij: OpenAI, Anthropic, Google, Mistral, Perplexity i Manus. Ovaj vodič objašnjava kako deep research agenti rade, što pokazuju benchmarkovi, koliko zapravo koštaju, gdje griješe i kako ih sigurno koristiti u tvrtki.

Od odgovora chatbota do istraživačkog izvještaja

Običan odgovor chatbota nastaje u jednom prolazu: model pročita pitanje, možda pokrene jednu ili dvije pretrage i napiše odgovor. Deep research agent radi u petlji. Razbije pitanje na potpitanja, pretražuje, čita, uočava praznine ili proturječja, ponovno pretražuje i tek onda piše izvještaj — obično od nekoliko stranica, s popisom izvora. Pristup spaja tri sposobnosti koje su sazrele istovremeno: modele zaključivanja koji mogu planirati i preispitivati, pouzdanu upotrebu alata za pregledavanje weba i čitanje datoteka te duge kontekstne prozore koji istovremeno drže desetke dokumenata.

Google je prvu široko dostupnu verziju predstavio kao Gemini Deep Research u prosincu 2024. OpenAI deep research slijedio je u veljači 2025., izgrađen na verziji modela o3 posebno treniranoj za pretraživanje weba, i brzo postao mjerilo. Perplexity je svoj alat lansirao istog mjeseca, Anthropic je Claudeu dodao Research u travnju 2025., Mistral je u srpnju 2025. dodao deep research način u Le Chat, a Manus je predstavio „Wide Research", koji zadatak raspoređuje na mnogo paralelnih agenata.

51,5%
točnost OpenAI deep researcha na BrowseCompu naspram 1,9% za GPT-4o s pretraživanjem
+90%
bolji rezultati Anthropicova multi-agentnog sustava u odnosu na jednog agenta (interna evaluacija)
~15×
više tokena troši multi-agentno istraživanje nego običan chat (Anthropic)

Što pokazuju benchmarkovi

Za procjenu istraživačkih agenata najkorisnija su dva benchmarka. BrowseComp, koji je OpenAI objavio u travnju 2025., sadrži 1.266 pitanja čije je odgovore teško pronaći, ali lako provjeriti — upravo ona koja zahtijevaju uporno pretraživanje mnogo stranica. Razlika između običnih modela i istreniranih istraživačkih agenata je golema:

Točnost na BrowseCompu (%) — teško dostupne činjenice s weba (OpenAI, travanj 2025.)

Drugi je Humanity's Last Exam (HLE), više od 2.500 pitanja stručne razine iz desetaka područja. Pri lansiranju je OpenAI deep research postigao 26,6%, a Perplexity Deep Research 21,1%, dok je većina tadašnjih standardnih modela bila na jednoznamenkastim rezultatima. Vodeći modeli iz 2026. postižu znatno više, ali pouka ranih brojki ostaje: pretraživanje i iteracija nadmašuju samo znanje modela kod teških, činjeničnih pitanja.

Točnost na Humanity's Last Examu (%) — rezultati s početka 2025.

Usporedba glavnih alata

AlatPrednostiNajbolje za
ChatGPT deep research (OpenAI)Uporno pretraživanje, jak u pronalaženju teško dostupnih činjenica, podrška za datoteke i konektore, dostupan preko API-jaPregled tržišta i konkurencije, pronalaženje činjenica, tehnička istraživanja
Claude Research (Anthropic)Multi-agentni dizajn s paralelnim podagentima, kombinira web s Google Workspaceom i alatima tvrtke povezanima preko MCP-aIstraživanja koja spajaju javni web i interne dokumente, dugi strukturirani izvještaji
Gemini Deep Research (Google)Istraživački plan koji se može urediti, dubina Google pretrage, integracija s WorkspaceomTimovi koji rade u Google Workspaceu, široki pregledi
Le Chat deep research (Mistral)Europski pružatelj, enterprise i on-premise opcije, višejezičnostOrganizacije sa zahtjevima za rezidentnost podataka u EU ili suverenost
Manus Wide ResearchMnogo agenata opće namjene paralelno, svaki obrađuje jednu stavku velikog popisaZadaci tipa „istraži 100 tvrtki/proizvoda", liste potencijalnih klijenata, usporedbe
Perplexity Deep ResearchBrzi odgovori s istaknutim izvorima, niska cijenaKratki brifinzi s vidljivim izvorima

Razlike između vodećih alata manje su od razlika između zadataka. Dobra je praksa isto važno pitanje provući kroz dva alata i usporediti rezultate — upravo tamo gdje se ne slažu, čovjek treba pogledati.

Zašto multi-agentno istraživanje radi — i zašto košta više

Anthropic je detaljno opisao kako je izgrađen Claude Research: glavni agent planira istraživanje i pokreće nekoliko podagenata koji pretražuju paralelno, svaki sa svojim kontekstnim prozorom, a zaseban korak provjerava citate. Na Anthropicovoj internoj evaluaciji istraživanja taj je multi-agentni sustav nadmašio jednog agenta za 90,2%. Glavni razlog je jednostavan: više ukupnog zaključivanja i pretraživanja raspoređenog na paralelne radnike. Ista analiza pokazala je da sama potrošnja tokena objašnjava oko 80% razlika u uspješnosti.

Druga strana medalje je trošak. Agenti troše otprilike 4× više tokena od chata, a multi-agentni sustavi oko 15× više. Zato potrošački paketi ograničavaju broj deep research pokretanja mjesečno, a procesi preko API-ja trebaju budžete, ograničenja dubine i pravila zaustavljanja. Naš vodič o troškovima AI inferencije objašnjava kako te brojke držati pod kontrolom.

Relativna potrošnja tokena po zadatku — chat, agent i multi-agentno istraživanje (Anthropic)

Poslovni slučajevi koji se isplate

Vrijeme za pregled tržišta od 10 stranica — analitičar naspram deep research procesa (ilustrativno, sati)

Ušteda vremena na grafikonu dolazi uglavnom iz faza prikupljanja i prvog nacrta. Provjera i prosudba ostaju ljudske — i trebaju dobiti više pažnje, ne manje, jer nacrt sada stiže vrlo brzo.

Gdje deep research agenti griješe

Pravilo palca: deep research izvještaj tretirajte kao rad brzog, načitanog mlađeg analitičara. Odličan je prvi nacrt i popis izvora — ali ne i konačan odgovor. Provjerite tri do pet tvrdnji o kojima vaša odluka stvarno ovisi.

Kako dobiti bolje istraživačke izvještaje

  1. Napišite pravi brief. Navedite cilj, odluku koju podržava, publiku, razdoblje, geografiju i format izlaza — kao što biste to napravili za analitičara.
  2. Odredite izvore. Navedite preferirane izvore (službena statistika, regulatori, financijska izvješća tvrtki) i one koje treba izbjegavati.
  3. Tražite razdvajanje. Zatražite jasnu podjelu na provjerene činjenice s citatima, procjene i vlastito tumačenje agenta.
  4. Iterirajte. Pregledajte plan ako ga alat prikazuje, zatim nadopunjujte praznine umjesto da krećete ispočetka.
  5. Standardizirajte. Ponavljajuća istraživanja — mjesečne preglede konkurencije, provjere dobavljača — pretvorite u predloške ili zakazane zadatke agenata s fiksnom strukturom.

Zaključak

Deep research agenti jedan su od najjasnijih primjera agentne umjetne inteligencije koja već danas donosi vrijednost: sate istraživanja sažimaju u minute i omogućuju istraživanje pitanja za koja prije ne biste imali vremena. Alati OpenAI-ja, Anthropica, Googlea, Mistrala i Manusa razlikuju se uglavnom po pristupu podacima, usklađenosti i stilu — ne po tome rade li. Tvrtke koje iz njih izvlače najviše pišu dobre briefove, povezuju prave interne izvore, planiraju trošak tokena i drže čovjeka odgovornim za provjeru onoga što je važno.

Želite istraživačke agente na svojim podacima?

Pomažemo tvrtkama u Hrvatskoj i DACH regiji uspostaviti deep research procese — od odabira pravog alata i pisanja istraživačkih predložaka do povezivanja internih izvora preko MCP-a i izgradnje provjerenih, automatiziranih istraživačkih procesa na Claudeu. Kao Claude Certified Architect iz Zagreba, činimo AI istraživanje dovoljno pouzdanim za stvarne odluke.

Razgovarajte s AI konzultantom