Embeddingi i vektorsko pretraživanje 2026: tihi motor iza RAG-a i AI memorije
Gotovo svaki koristan AI sustav koji ste dotaknuli ove godine — chatbot koji odgovara iz dokumenata vaše tvrtke, alat za podršku koji pronalazi pravi prošli tiket, agent koji pamti razgovor od prošlog tjedna — pokreće isti neupadljivi sloj ispod: embeddingi i vektorsko pretraživanje. To je dio koji nitko ne demonstrira i dio koji tiho odlučuje hoće li vaš RAG sustav djelovati kao čarolija ili kao pokvaren. Ovo je vodič običnim jezikom o tome što su embeddingi, kako radi vektorsko pretraživanje i koje odluke u 2026. razdvajaju sloj dohvaćanja koji radi od onoga koji samouvjereno vraća besmislice.
Što je embedding zapravo
Embedding je način pretvaranja teksta — rečenice, odlomka, cijelog dijela dokumenta — u niz brojeva, vektor, koji hvata njegovo značenje. Moderni embedding model pročita „Kako resetiram lozinku?" i ispiše nekoliko stotina do nekoliko tisuća brojeva. Trik je u tome da tekstovi sličnog značenja završe blizu jedan drugoga u tom prostoru, čak i kad ne dijele nijednu riječ. „Resetiraj lozinku" i „Zaboravio sam pristupne podatke" nalaze se blizu; „resetiraj lozinku" i „vrati router na tvorničke postavke" su dalje. To je cijela ideja: značenje postaje geometrija, a kad je značenje geometrija, računalo ga može pretraživati po udaljenosti.
Od teksta do odgovora: petlja dohvaćanja
U tipičnom stogu 2026. tok je isti gradili vi help desk ili dugoročnu memoriju agenta:
- Chunk i embed. Podijelite dokumente u odlomke, provucite svaki kroz embedding model i pohranite dobivene vektore u vektorsku bazu. To radite jednom, unaprijed.
- Embed upita. Kad korisnik nešto pita, pitanje se embeddira istim modelom.
- Pretraga po udaljenosti. Pronađite pohranjene vektore najbliže vektoru upita — obično po kosinusnoj sličnosti — i vratite nekoliko najboljih odlomaka.
- Utemeljenje odgovora. Predajte te odlomke jezičnom modelu kao kontekst, kako bi odgovarao iz vaših podataka umjesto iz svoje memorije.
Svaki neuspjeh koji ljudi pripisuju „AI halucinaciji" obično se dogodi u koraku 3. Ako pravi odlomak nikad nije dohvaćen, model nikad nije dobio priliku biti u pravu.
Izbor dimenzije: veće nije automatski bolje
Embedding modeli omogućuju razmjenu veličine vektora za trošak i brzinu. Vektor veće dimenzije može uhvatiti finije razlike, ali košta više za pohranu, traži više memorije u indeksu i više vremena za usporedbu. U 2026. mnogi modeli podržavaju skraćene embeddinge (obučene u Matryoshka stilu) — možete zadržati prvih 512 od 1536 dimenzija i izgubiti iznenađujuće malo točnosti. Optimalna točka za većinu poslovnog pretraživanja manja je nego što timovi pretpostavljaju: kvaliteta dohvaćanja obično se izravna mnogo prije maksimalne dimenzije, dok trošak pohrane raste linearno.
Vektorske baze i trik s brzinom
Usporediti upit s milijunima vektora jedan po jedan bilo bi predaleko sporo za živi proizvod. Vektorske baze to rješavaju indeksima aproksimativnih najbližih susjeda (ANN) — strukturama poput HNSW-a koje pronalaze najbliže vektore bez provjere svakoga, mijenjajući sićušnu, podesivu količinu točnosti za golem dobitak u brzini. Rezultat je pretraga u podmilisekundnom vremenu nad milijunima stavki. Praktična odluka manje je „koja je baza najbolja", a više „upravljano ili samostalno hostano": upravljana vektorska usluga uklanja operativni teret, dok samostalno hostani indeks daje kontrolu nad lokacijom podataka — što je važno timovima pod EU pravilima o podacima.
| Odluka | Opcija A | Opcija B | Pravilo palca |
|---|---|---|---|
| Gdje pokretati | Upravljana vektorska usluga | Samostalno (HNSW / pgvector) | Upravljano osim ako lokacija podataka ili trošak na skali ne nalažu samostalno |
| Veličina vektora | Puna dimenzija | Skraćena (512–768) | Počnite skraćeno; rastite samo ako testovi recalla to zahtijevaju |
| Vrsta pretrage | Čisto vektorska | Hibridna (vektor + ključne riječi) | Hibridna pobjeđuje za većinu stvarnih korpusa s nazivima, šiframa, akronimima |
| Nakon pretrage | Top-k kakav jest | Rerank top-k | Dodajte reranker kad je preciznost prva 3 rezultata bitna |
Zašto čisto vektorsko nije dovoljno: hibridno + reranking
Semantičko pretraživanje briljantno je u značenju i iznenađujuće loše u točnim nizovima. Tražite li fakturu „INV-2026-0847" ili šifru proizvoda „X‑42B", vektorski model može veselo vratiti semantički slične ali pogrešne stavke, jer te šifre nemaju značenje za embeddiranje. Zadano u 2026. je hibridno pretraživanje: pokrenite klasičnu pretragu ključnih riječi (BM25) i vektorsku pretragu paralelno, pa spojite rezultate. Ključne riječi hvataju točne tokene; vektori hvataju parafraze. Povrh toga, reranker — mali model koji ponovno ocjenjuje najbolje kandidate prema upitu — dramatično izoštrava preciznost nekolicine odlomaka koje zapravo predajete modelu.
Koliko košta pokretanje
Embeddingi su jedan od najjeftinijih dijelova AI stoga — reda veličine jeftiniji po tokenu od generiranja — ali troškovi su stvarni na skali i lako ih je zaboraviti. Plaćate embeddiranje korpusa jednom (i ponovno kad god reindeksirate ili promijenite model), embeddiranje svakog dolaznog upita te pohranu i posluživanje vektora u memoriji. Način neuspjeha nije šokantan račun; to je ponovno embeddiranje velikog korpusa jer nitko nije zabilježio koji su model i verzija proizveli postojeće vektore. Odaberite embedding model promišljeno, fiksirajte verziju i tretirajte promjenu modela kao migraciju.
Kako to ispravno napraviti: kratka lista
- Koristite jedan embedding model posvuda. Upiti i dokumenti moraju biti embeddirani istim modelom i verzijom, inače se geometrija ne poklapa.
- Zadano hibridno pretraživanje. Kombinirajte ključne riječi i vektor osim ako niste dokazali da je čisto vektorsko dovoljno za vaše podatke.
- Chunkajte po značenju, čuvajte metapodatke. Prirodne granice, lagano preklapanje te polja izvora/datuma za filtriranje i citate.
- Dodajte reranker kad je preciznost bitna. To je nadogradnja s najvećom polugom za pritužbe „najbolji odgovor je pogrešan".
- Mjerite recall stvarnim testnim skupom. Izgradite mali skup parova pitanje→točan odlomak i pratite pronalazi li ih dohvaćanje. Ne možete poboljšati ono što ne mjerite.
Zaključak
Embeddingi i vektorsko pretraživanje sloj su koji hrpu dokumenata pretvara u nešto o čemu AI može zaključivati — temelj ispod RAG-a, semantičkog pretraživanja, preporuka i memorije agenata. U 2026. modeli su jeftini, a baze brze, pa prednost više ne dolazi od najotmjenijeg embedding modela. Dolazi od dosadnih odluka: razumnog chunkinga, hibridnog pretraživanja, rerankera gdje preciznost broji i poštenog testa recalla koji dokazuje da radi. Postavite sloj dohvaćanja ispravno i model iznad izgleda briljantno. Postavite ga krivo i nikakav prompt engineering neće spasiti odgovor.
Izgradite sloj dohvaćanja kojem možete vjerovati
Pomažemo timovima dizajnirati i podesiti semantičko pretraživanje i RAG od početka do kraja — embedding model i dimenziju, chunking, hibridno pretraživanje, reranking i testiranje recalla — na Anthropicu, OpenAI-u, Mistralu i samostalno hostanim stogovima, s riješenom lokacijom podataka za EU zahtjeve.
Razgovarajte s AI konzultantom