Boris Agatić · · 9 min čitanja

Embeddingi i vektorsko pretraživanje 2026: tihi motor iza RAG-a i AI memorije

Gotovo svaki koristan AI sustav koji ste dotaknuli ove godine — chatbot koji odgovara iz dokumenata vaše tvrtke, alat za podršku koji pronalazi pravi prošli tiket, agent koji pamti razgovor od prošlog tjedna — pokreće isti neupadljivi sloj ispod: embeddingi i vektorsko pretraživanje. To je dio koji nitko ne demonstrira i dio koji tiho odlučuje hoće li vaš RAG sustav djelovati kao čarolija ili kao pokvaren. Ovo je vodič običnim jezikom o tome što su embeddingi, kako radi vektorsko pretraživanje i koje odluke u 2026. razdvajaju sloj dohvaćanja koji radi od onoga koji samouvjereno vraća besmislice.

Što je embedding zapravo

Embedding je način pretvaranja teksta — rečenice, odlomka, cijelog dijela dokumenta — u niz brojeva, vektor, koji hvata njegovo značenje. Moderni embedding model pročita „Kako resetiram lozinku?" i ispiše nekoliko stotina do nekoliko tisuća brojeva. Trik je u tome da tekstovi sličnog značenja završe blizu jedan drugoga u tom prostoru, čak i kad ne dijele nijednu riječ. „Resetiraj lozinku" i „Zaboravio sam pristupne podatke" nalaze se blizu; „resetiraj lozinku" i „vrati router na tvorničke postavke" su dalje. To je cijela ideja: značenje postaje geometrija, a kad je značenje geometrija, računalo ga može pretraživati po udaljenosti.

256–4096
tipičan broj dimenzija po embedding vektoru u produkcijskim modelima 2026.
~1 ms
za pretragu milijuna vektora s dobrim aproksimativnim indeksom
2
signala dohvaćanja koja vrijedi kombinirati: semantički (vektori) + ključne riječi (BM25)

Od teksta do odgovora: petlja dohvaćanja

U tipičnom stogu 2026. tok je isti gradili vi help desk ili dugoročnu memoriju agenta:

  1. Chunk i embed. Podijelite dokumente u odlomke, provucite svaki kroz embedding model i pohranite dobivene vektore u vektorsku bazu. To radite jednom, unaprijed.
  2. Embed upita. Kad korisnik nešto pita, pitanje se embeddira istim modelom.
  3. Pretraga po udaljenosti. Pronađite pohranjene vektore najbliže vektoru upita — obično po kosinusnoj sličnosti — i vratite nekoliko najboljih odlomaka.
  4. Utemeljenje odgovora. Predajte te odlomke jezičnom modelu kao kontekst, kako bi odgovarao iz vaših podataka umjesto iz svoje memorije.

Svaki neuspjeh koji ljudi pripisuju „AI halucinaciji" obično se dogodi u koraku 3. Ako pravi odlomak nikad nije dohvaćen, model nikad nije dobio priliku biti u pravu.

Izbor dimenzije: veće nije automatski bolje

Embedding modeli omogućuju razmjenu veličine vektora za trošak i brzinu. Vektor veće dimenzije može uhvatiti finije razlike, ali košta više za pohranu, traži više memorije u indeksu i više vremena za usporedbu. U 2026. mnogi modeli podržavaju skraćene embeddinge (obučene u Matryoshka stilu) — možete zadržati prvih 512 od 1536 dimenzija i izgubiti iznenađujuće malo točnosti. Optimalna točka za većinu poslovnog pretraživanja manja je nego što timovi pretpostavljaju: kvaliteta dohvaćanja obično se izravna mnogo prije maksimalne dimenzije, dok trošak pohrane raste linearno.

Kvaliteta dohvaćanja naspram troška pohrane po dimenziji embeddinga (ilustrativno)

Vektorske baze i trik s brzinom

Usporediti upit s milijunima vektora jedan po jedan bilo bi predaleko sporo za živi proizvod. Vektorske baze to rješavaju indeksima aproksimativnih najbližih susjeda (ANN) — strukturama poput HNSW-a koje pronalaze najbliže vektore bez provjere svakoga, mijenjajući sićušnu, podesivu količinu točnosti za golem dobitak u brzini. Rezultat je pretraga u podmilisekundnom vremenu nad milijunima stavki. Praktična odluka manje je „koja je baza najbolja", a više „upravljano ili samostalno hostano": upravljana vektorska usluga uklanja operativni teret, dok samostalno hostani indeks daje kontrolu nad lokacijom podataka — što je važno timovima pod EU pravilima o podacima.

OdlukaOpcija AOpcija BPravilo palca
Gdje pokretatiUpravljana vektorska uslugaSamostalno (HNSW / pgvector)Upravljano osim ako lokacija podataka ili trošak na skali ne nalažu samostalno
Veličina vektoraPuna dimenzijaSkraćena (512–768)Počnite skraćeno; rastite samo ako testovi recalla to zahtijevaju
Vrsta pretrageČisto vektorskaHibridna (vektor + ključne riječi)Hibridna pobjeđuje za većinu stvarnih korpusa s nazivima, šiframa, akronimima
Nakon pretrageTop-k kakav jestRerank top-kDodajte reranker kad je preciznost prva 3 rezultata bitna

Zašto čisto vektorsko nije dovoljno: hibridno + reranking

Semantičko pretraživanje briljantno je u značenju i iznenađujuće loše u točnim nizovima. Tražite li fakturu „INV-2026-0847" ili šifru proizvoda „X‑42B", vektorski model može veselo vratiti semantički slične ali pogrešne stavke, jer te šifre nemaju značenje za embeddiranje. Zadano u 2026. je hibridno pretraživanje: pokrenite klasičnu pretragu ključnih riječi (BM25) i vektorsku pretragu paralelno, pa spojite rezultate. Ključne riječi hvataju točne tokene; vektori hvataju parafraze. Povrh toga, reranker — mali model koji ponovno ocjenjuje najbolje kandidate prema upitu — dramatično izoštrava preciznost nekolicine odlomaka koje zapravo predajete modelu.

Točnost dohvaćanja po metodi (ilustrativno, više je bolje)
Chunking je mjesto gdje većina projekata tiho uspije ili padne. Kako dijelite dokumente prije embeddiranja jednako je važno kao i koji model odaberete. Preveliki dijelovi zakopaju relevantnu rečenicu u šumu; premali gube kontekst koji ih je učinio smislenima. Dijelite na prirodnim granicama — naslovi, odlomci, sekcije — zadržite malo preklapanja da ideje koje prelaze granicu ne budu presječene na pola, i pohranite metapodatke (izvor, datum, sekcija) uz svaki vektor kako biste mogli filtrirati i citirati. Dobar chunking pobjeđuje otmjeniji embedding model mnogo češće nego što timovi očekuju.

Koliko košta pokretanje

Embeddingi su jedan od najjeftinijih dijelova AI stoga — reda veličine jeftiniji po tokenu od generiranja — ali troškovi su stvarni na skali i lako ih je zaboraviti. Plaćate embeddiranje korpusa jednom (i ponovno kad god reindeksirate ili promijenite model), embeddiranje svakog dolaznog upita te pohranu i posluživanje vektora u memoriji. Način neuspjeha nije šokantan račun; to je ponovno embeddiranje velikog korpusa jer nitko nije zabilježio koji su model i verzija proizveli postojeće vektore. Odaberite embedding model promišljeno, fiksirajte verziju i tretirajte promjenu modela kao migraciju.

Kako to ispravno napraviti: kratka lista

  1. Koristite jedan embedding model posvuda. Upiti i dokumenti moraju biti embeddirani istim modelom i verzijom, inače se geometrija ne poklapa.
  2. Zadano hibridno pretraživanje. Kombinirajte ključne riječi i vektor osim ako niste dokazali da je čisto vektorsko dovoljno za vaše podatke.
  3. Chunkajte po značenju, čuvajte metapodatke. Prirodne granice, lagano preklapanje te polja izvora/datuma za filtriranje i citate.
  4. Dodajte reranker kad je preciznost bitna. To je nadogradnja s najvećom polugom za pritužbe „najbolji odgovor je pogrešan".
  5. Mjerite recall stvarnim testnim skupom. Izgradite mali skup parova pitanje→točan odlomak i pratite pronalazi li ih dohvaćanje. Ne možete poboljšati ono što ne mjerite.

Zaključak

Embeddingi i vektorsko pretraživanje sloj su koji hrpu dokumenata pretvara u nešto o čemu AI može zaključivati — temelj ispod RAG-a, semantičkog pretraživanja, preporuka i memorije agenata. U 2026. modeli su jeftini, a baze brze, pa prednost više ne dolazi od najotmjenijeg embedding modela. Dolazi od dosadnih odluka: razumnog chunkinga, hibridnog pretraživanja, rerankera gdje preciznost broji i poštenog testa recalla koji dokazuje da radi. Postavite sloj dohvaćanja ispravno i model iznad izgleda briljantno. Postavite ga krivo i nikakav prompt engineering neće spasiti odgovor.

Izgradite sloj dohvaćanja kojem možete vjerovati

Pomažemo timovima dizajnirati i podesiti semantičko pretraživanje i RAG od početka do kraja — embedding model i dimenziju, chunking, hibridno pretraživanje, reranking i testiranje recalla — na Anthropicu, OpenAI-u, Mistralu i samostalno hostanim stogovima, s riješenom lokacijom podataka za EU zahtjeve.

Razgovarajte s AI konzultantom