Usmjeravanje AI modela 2026: pošaljite svaki zadatak pravom modelu i smanjite trošak 60%
Većina timova odabere jedan model, ugradi ga posvuda i plaća premijsku cijenu za posao kakav većina upita nikad nije trebala. No „sažmi ovo u jednu rečenicu” i „refaktoriraj ovaj naslijeđeni servis” nisu isti posao i ne bi trebali ići istom modelu. Usmjeravanje modela (routing) disciplina je slanja svakog upita najjeftinijem modelu koji ga i dalje može dobro riješiti — mali, brzi model za laku većinu, vrhunski model za tešku manjinu — često miješajući Anthropic, OpenAI i Mistral iza jednog API-ja. U 2026. to je pojedinačna promjena s najvećom polugom na vašem AI računu, a najčešće povisuje percipiranu kvalitetu, a ne snižava je. Evo kako radi i kako ga izgraditi bez žaljenja.
Zašto je jedan model za sve skupa pogreška
Vrhunski modeli naplaćuju se prema svojoj najtežoj upotrebi. Kad svaki upit šaljete najskupljem modelu, plaćate cijenu za teške probleme na bujici trivijalnih — klasifikacije, kratka prepisivanja, ekstrakcije, rutinska pitanja — na koja bi model 10–30× jeftiniji odgovorio jednako točno. Rasipanje je nevidljivo jer je svaki poziv jeftin; pojavi se tek na dnu mjesečnog računa, kad ga količina pomnoži.
Uvid iza usmjeravanja jednostavan je: težina upita krajnje je neravnomjerna. U većini produkcijskog prometa većina poziva je laka, a manjina je stvarno teška. Laku većinu poslužite iz malog modela, a tešku manjinu iz velikog, i zadržat ćete gotovo svu kvalitetu uz djelić troška. To je ista logika „ne preplaćuj lagani slučaj” iza predmemoriranja upita i malih jezičnih modela — usmjeravanje je ono što povezuje te poluge.
Tri načina usmjeravanja
1. Kaskada (eskalacija pri neuspjehu)
Upit prvo pošaljite jeftinom modelu. Provjerite odgovor — ocjenom pouzdanosti, validatorom, provjerom sheme ili brzim testom „je li ovo stvarno uspjelo?”. Ako prođe, gotovi ste po niskoj cijeni. Ako padne, eskalirajte na jači model. Kaskade su najpouzdaniji obrazac jer je skupi model prava sigurnosna mreža: plaćate ga samo na upitima kojima je uistinu trebao.
2. Prediktivno usmjeravanje (prvo klasificiraj)
Mali, brzi klasifikator pogleda dolazni upit i predvidi koji model treba prije nego što išta potroši na generiranje. Kratko činjenično pretraživanje → mali model. Višekorak rezoniranje, dug kod, suptilna procjena → vrhunski model. Time se izbjegava dvostruki trošak inferencije kaskade, po cijenu povremenog pogrešnog usmjeravanja teškog upita slabom modelu — pa se dobro slaže s rezervnom provjerom.
3. Semantičko usmjeravanje (po sposobnosti)
Usmjeravajte prema tome što je zadatak, ne samo koliko je težak. Kod ide modelu koji je najjači u kodu; rad s dugim kontekstom ide modelu s najvećim pouzdanim kontekstnim prozorom; jeftina masovna klasifikacija ide malom otvorenom modelu koji sami hostate. Tu se isplati miješanje dobavljača — nijedan laboratorij ne pobjeđuje u svakoj kategoriji, a usmjerivač vam omogućuje da odaberete najbolji alat za svaki posao umjesto da se zadovoljite jednim svestranim.
Što se zapravo uštedi
Brojke ovise o vašem miksu prometa, ali oblik je dosljedan: što je promet više nagnut prema lakim upitima, to usmjeravanje više štedi. Sandučić podrške koji je 80% rutinskih i 20% složenih poziva štedi daleko više od radnog opterećenja s ujednačeno teškim istraživačkim pitanjima. Tablica prikazuje reprezentativnu raspodjelu.
| Razina prometa | Udio poziva | Usmjereno na | Relativni trošak |
|---|---|---|---|
| Trivijalno (klasifikacija, ekstrakcija, kratko prepisivanje) | ~55% | Mali model | 1× |
| Umjereno (sažeci, rutinska pitanja, nacrti) | ~30% | Srednji model | ~5× |
| Teško (višekorak rezoniranje, dug kod, procjena) | ~15% | Vrhunski model | ~25× |
Kvaka: usmjeravanje nije besplatno
Usmjeravanje dodaje pokretni dio, a pokretni dijelovi znaju zakazati. Iskreni rizici:
- Pogrešno usmjeravanje. Pošaljete li teški upit slabom modelu, dobit ćete samouvjeren, netočan odgovor po sniženoj cijeni — gore nego da ste platili punu. Osigurajte nedostatak validatorom ili rezervnom kaskadom, a ne slijepim povjerenjem u klasifikator.
- Latencija i trošak usmjerivača. Prediktivni klasifikator je dodatni poziv. Neka bude sitan i brz, inače će režija usmjeravanja pojesti uštedu.
- Nedosljednost među dobavljačima. Različiti modeli različito formatiraju, odbijaju i rezoniraju. Normalizirajte izlaze i testirajte promptove na svakom modelu u skupu, ili će korisnici osjetiti šavove.
- Operativna površina. Više dobavljača znači više ključeva, ograničenja, ispada i stavki računa. Sloj evaluacije i observabilnosti ono je što višemodelno okruženje drži poštenim.
Kako ga uvesti
- Izmjerite prije usmjeravanja. Zabilježite trenutni promet i klasificirajte uzorak po težini. Ako je 90% poziva stvarno teško, usmjeravanje neće mnogo uštedjeti — znajte to prvo.
- Počnite s dvorazinskom kaskadom. Jeftini model prvo, vrhunski pri neuspjehu. Najjednostavniji je i najsigurniji obrazac jer jaki model uvijek hvata pad.
- Definirajte „dovoljno dobro” po zadatku. Validator ili evaluacijski skup koji odlučuje prolaz/pad srce je svakog usmjerivača. Bez njega ne možete sigurno usmjeravati.
- Dodajte semantičko usmjeravanje kad imate podatke. Kad znate da se kod, dugi kontekst i masovni zadaci ponašaju drukčije, razdvojite ih modelu koji pobjeđuje u svakoj kategoriji.
- Pratite kvalitetu, ne samo trošak. Uz potrošnju pratite stopu eskalacije i signale zadovoljstva korisnika. Padajući račun uz rastuću stopu pritužbi lažna je pobjeda.
- Neka usmjerivač bude zamjenjiv. Cijene i ljestvice modela mijenjaju se mjesečno. Stavite usmjeravanje iza čiste apstrakcije da zamjena modela bude promjena konfiguracije, a ne prepisivanje.
Zaključak
Usmjeravanje modela pretvara „koji model koristiti?” iz jednokratne odluke u odluku po upitu — a to je upravo prava razina. Laka većina vašeg prometa ne zaslužuje vaš najskuplji model, a vaši najteži upiti ne zaslužuju ništa manje. Dobar usmjerivač svakome daje ono što treba, reže račun 40–70% uz istu kvalitetu i oslobađa vas kladenja cijelog proizvoda na plan puta jednog dobavljača. U 2026. tretiranje modela kao portfelja kroz koji usmjeravate — umjesto jednog prvaka za kojeg se vežete — jedan je od najčišćih dobitaka dostupnih u primijenjenom AI-ju.
Plaćate vrhunske cijene za lagane upite?
Pomažemo timovima osmisliti usmjeravanje modela koje reže AI račune 40–70% bez gubitka kvalitete — kaskade, semantičko usmjeravanje i validacijski sloj koji ga drži sigurnim, kroz Anthropic, OpenAI, Mistral i samostalno hostane modele.
Razgovarajte s AI konzultantom