Boris Agatić · · 9 min čitanja

Usmjeravanje AI modela 2026: pošaljite svaki zadatak pravom modelu i smanjite trošak 60%

Većina timova odabere jedan model, ugradi ga posvuda i plaća premijsku cijenu za posao kakav većina upita nikad nije trebala. No „sažmi ovo u jednu rečenicu” i „refaktoriraj ovaj naslijeđeni servis” nisu isti posao i ne bi trebali ići istom modelu. Usmjeravanje modela (routing) disciplina je slanja svakog upita najjeftinijem modelu koji ga i dalje može dobro riješiti — mali, brzi model za laku većinu, vrhunski model za tešku manjinu — često miješajući Anthropic, OpenAI i Mistral iza jednog API-ja. U 2026. to je pojedinačna promjena s najvećom polugom na vašem AI računu, a najčešće povisuje percipiranu kvalitetu, a ne snižava je. Evo kako radi i kako ga izgraditi bez žaljenja.

Zašto je jedan model za sve skupa pogreška

Vrhunski modeli naplaćuju se prema svojoj najtežoj upotrebi. Kad svaki upit šaljete najskupljem modelu, plaćate cijenu za teške probleme na bujici trivijalnih — klasifikacije, kratka prepisivanja, ekstrakcije, rutinska pitanja — na koja bi model 10–30× jeftiniji odgovorio jednako točno. Rasipanje je nevidljivo jer je svaki poziv jeftin; pojavi se tek na dnu mjesečnog računa, kad ga količina pomnoži.

Uvid iza usmjeravanja jednostavan je: težina upita krajnje je neravnomjerna. U većini produkcijskog prometa većina poziva je laka, a manjina je stvarno teška. Laku većinu poslužite iz malog modela, a tešku manjinu iz velikog, i zadržat ćete gotovo svu kvalitetu uz djelić troška. To je ista logika „ne preplaćuj lagani slučaj” iza predmemoriranja upita i malih jezičnih modela — usmjeravanje je ono što povezuje te poluge.

40–70%
tipično smanjenje AI troška usmjeravanjem prometa na primjereno velike modele, uz istu kvalitetu
~70%
udio produkcijskih upita koje mali/srednji model riješi jednako dobro kao vrhunski
10–30×
razlika u cijeni po tokenu između vrhunskog i sposobnog malog modela

Tri načina usmjeravanja

1. Kaskada (eskalacija pri neuspjehu)

Upit prvo pošaljite jeftinom modelu. Provjerite odgovor — ocjenom pouzdanosti, validatorom, provjerom sheme ili brzim testom „je li ovo stvarno uspjelo?”. Ako prođe, gotovi ste po niskoj cijeni. Ako padne, eskalirajte na jači model. Kaskade su najpouzdaniji obrazac jer je skupi model prava sigurnosna mreža: plaćate ga samo na upitima kojima je uistinu trebao.

2. Prediktivno usmjeravanje (prvo klasificiraj)

Mali, brzi klasifikator pogleda dolazni upit i predvidi koji model treba prije nego što išta potroši na generiranje. Kratko činjenično pretraživanje → mali model. Višekorak rezoniranje, dug kod, suptilna procjena → vrhunski model. Time se izbjegava dvostruki trošak inferencije kaskade, po cijenu povremenog pogrešnog usmjeravanja teškog upita slabom modelu — pa se dobro slaže s rezervnom provjerom.

3. Semantičko usmjeravanje (po sposobnosti)

Usmjeravajte prema tome što je zadatak, ne samo koliko je težak. Kod ide modelu koji je najjači u kodu; rad s dugim kontekstom ide modelu s najvećim pouzdanim kontekstnim prozorom; jeftina masovna klasifikacija ide malom otvorenom modelu koji sami hostate. Tu se isplati miješanje dobavljača — nijedan laboratorij ne pobjeđuje u svakoj kategoriji, a usmjerivač vam omogućuje da odaberete najbolji alat za svaki posao umjesto da se zadovoljite jednim svestranim.

Trošak na 1.000 upita — jedan vrhunski model vs usmjereni miks (ilustrativno)

Što se zapravo uštedi

Brojke ovise o vašem miksu prometa, ali oblik je dosljedan: što je promet više nagnut prema lakim upitima, to usmjeravanje više štedi. Sandučić podrške koji je 80% rutinskih i 20% složenih poziva štedi daleko više od radnog opterećenja s ujednačeno teškim istraživačkim pitanjima. Tablica prikazuje reprezentativnu raspodjelu.

Razina prometaUdio pozivaUsmjereno naRelativni trošak
Trivijalno (klasifikacija, ekstrakcija, kratko prepisivanje)~55%Mali model
Umjereno (sažeci, rutinska pitanja, nacrti)~30%Srednji model~5×
Teško (višekorak rezoniranje, dug kod, procjena)~15%Vrhunski model~25×
Produkcijski promet po težini — gdje upiti zapravo završe (ilustrativno)

Kvaka: usmjeravanje nije besplatno

Usmjeravanje dodaje pokretni dio, a pokretni dijelovi znaju zakazati. Iskreni rizici:

Pravilo koje čuva usmjeravanje sigurnim: nikad ne dopustite da jeftina putanja tiho zakaže. Svaki usmjereni upit treba način da otkrije loš odgovor — provjeru sheme, prag pouzdanosti, validator ili signal korisnika — i definiranu eskalaciju kad se to dogodi. Usmjeravanje bez rezerve puko je kockanje s kvalitetom radi uštede; usmjeravanje s rezervom način je da dobijete uštedu i zadržite povjerenje.

Kako ga uvesti

  1. Izmjerite prije usmjeravanja. Zabilježite trenutni promet i klasificirajte uzorak po težini. Ako je 90% poziva stvarno teško, usmjeravanje neće mnogo uštedjeti — znajte to prvo.
  2. Počnite s dvorazinskom kaskadom. Jeftini model prvo, vrhunski pri neuspjehu. Najjednostavniji je i najsigurniji obrazac jer jaki model uvijek hvata pad.
  3. Definirajte „dovoljno dobro” po zadatku. Validator ili evaluacijski skup koji odlučuje prolaz/pad srce je svakog usmjerivača. Bez njega ne možete sigurno usmjeravati.
  4. Dodajte semantičko usmjeravanje kad imate podatke. Kad znate da se kod, dugi kontekst i masovni zadaci ponašaju drukčije, razdvojite ih modelu koji pobjeđuje u svakoj kategoriji.
  5. Pratite kvalitetu, ne samo trošak. Uz potrošnju pratite stopu eskalacije i signale zadovoljstva korisnika. Padajući račun uz rastuću stopu pritužbi lažna je pobjeda.
  6. Neka usmjerivač bude zamjenjiv. Cijene i ljestvice modela mijenjaju se mjesečno. Stavite usmjeravanje iza čiste apstrakcije da zamjena modela bude promjena konfiguracije, a ne prepisivanje.

Zaključak

Usmjeravanje modela pretvara „koji model koristiti?” iz jednokratne odluke u odluku po upitu — a to je upravo prava razina. Laka većina vašeg prometa ne zaslužuje vaš najskuplji model, a vaši najteži upiti ne zaslužuju ništa manje. Dobar usmjerivač svakome daje ono što treba, reže račun 40–70% uz istu kvalitetu i oslobađa vas kladenja cijelog proizvoda na plan puta jednog dobavljača. U 2026. tretiranje modela kao portfelja kroz koji usmjeravate — umjesto jednog prvaka za kojeg se vežete — jedan je od najčišćih dobitaka dostupnih u primijenjenom AI-ju.

Plaćate vrhunske cijene za lagane upite?

Pomažemo timovima osmisliti usmjeravanje modela koje reže AI račune 40–70% bez gubitka kvalitete — kaskade, semantičko usmjeravanje i validacijski sloj koji ga drži sigurnim, kroz Anthropic, OpenAI, Mistral i samostalno hostane modele.

Razgovarajte s AI konzultantom