Boris Agatić · · 9 min čitanja

Mali jezični modeli i Edge AI 2026: Zašto manje pobjeđuje u produkciji

Tri godine priča o umjetnoj inteligenciji bila je utrka prema vrhu: veći modeli, dulji kontekst, viši rezultati na benchmarkovima. U 2026. tiša i važnija priča teče u suprotnom smjeru. Modeli koji obavljaju najveći dio stvarnog posla unutar tvrtki više nisu najveći — oni su mali, brzi i jeftini dovoljno da rade na prijenosnom računalu, telefonu ili skromnom poslužitelju. Mali jezični modeli (SLM) i implementacija na rubu mreže pretvorili su pitanje „koji je model najpametniji" u pogrešno pitanje. Pravo pitanje glasi: koji je najmanji model koji prelazi prag za ovaj zadatak — i gdje bi trebao raditi?

Što se u 2026. smatra „malim"

Ne postoji službeno usuglašena granica, no u praksi je SLM model dovoljno malen da se jeftino poslužuje u velikom opsegu ili da radi izvan podatkovnog centra — otprilike od nekoliko stotina milijuna do nekoliko desetaka milijardi parametara. U kategoriju spadaju hostane učinkovite razine poput Claude Haikua, Mistralovi mali i edge modeli te sve veći niz modela otvorenih težina namijenjenih radu na uređaju. Ne ujedinjuje ih broj parametara, nego svrha: obaviti dobro definiran posao uz djelić troška, latencije i energije vrhunskog modela.

Razlog zašto je to postalo izvedivo tako brzo jest to što se jaz u korisnoj sposobnosti sužavao čak i dok se jaz u veličini širio. Destilacija — treniranje malog modela na izlazima većeg — uz bolju kuraciju podataka i kvantizaciju znači da mali model iz 2026. često dostiže flagship iz 2024. na zadacima koje tvrtke zaista pokreću: klasifikaciji, ekstrakciji, sažimanju, usmjeravanju i strukturiranom pisanju. Granica se nastavila pomicati, ali se pod dizao brže.

10–30×
jeftiniji po tokenu od vrhunskog modela na usporedivim rutinskim zadacima
~70%
poslovnih AI poziva u potpunosti je u dosegu malog modela
<100ms
tipičan odziv na uređaju bez odlaska na mrežu
Trošak po milijunu tokena — razine modela (2026., ilustrativno)

Zašto manje pobjeđuje ondje gdje je važno

Privlačnost nije štedljivost radi štedljivosti. Četiri sile guraju implementacije prema najmanjem sposobnom modelu, i one se zbrajaju.

1. Trošak koji raste s upotrebom, a ne s ambicijom

Vrhunski model je povoljan za teško, povremeno pitanje i skup za milijun rutinskih. Većina poslovnih opterećenja je ovo drugo — isti korak ekstrakcije ili klasifikacije, pokrenut beskonačno. Premještanje tog volumena na mali model smanjuje račun za inferenciju za red veličine bez diranja kvalitete ondje gdje je ona već dovoljna. Granica se tada rezervira za onaj dio poziva kojima je uistinu potrebna.

2. Latencija koju osjetite

Mali model vraća odgovor u djeliću vremena, a model koji radi na uređaju vraća ga bez ijednog skoka na mrežu. Za bilo što interaktivno — pomoćnika za podršku, asistenta u aplikaciji, glasovnog agenta — razlika između 90 milisekundi i dvije sekunde razlika je između alata koji ljudi koriste i onoga koji napuštaju.

3. Privatnost i rezidentnost podataka po dizajnu

Kad model radi na uređaju ili unutar vaše vlastite mreže, osjetljivi podaci nikada je ne napuštaju. To pretvara glavobolju s usklađenošću u nebitnost za regulirani rad u zdravstvu, financijama i javnom sektoru — isti pritisci upravljanja koje pokrivamo u našem vodiču o AI regulativi. Bez poziva na API treće strane nema što bilježiti, redigirati ili objašnjavati revizoru.

4. Otpornost i rad izvan mreže

Edge model nastavlja raditi kad veza padne — na proizvodnom pogonu, u vozilu, u ambulanti s isprekidanim Wi-Fijem. Također uklanja jedinstvenu točku kvara: vaš proizvod ne pada u mrak jer je uzvodni API imao loše popodne.

Kamo se seli opterećenje — udio poslovnih AI poziva po razini modela

Dvorazinski sustav sada je zadano rješenje

Pogreška iz 2024. bila je birati jedan model za sve. Obrazac koji funkcionira u 2026. jest usmjerivač (router): jeftin model prvog prolaza obrađuje najveći dio prometa, a samo pozivi kojima treba dublje zaključivanje eskaliraju do vrhunskog modela. Kad se dobro izvede, većinu zahtjeva rješava mala razina, a skupa se troši ondje gdje posljedica to opravdava — ista disciplina odnosa troška i posljedice koja stoji iza našeg vodiča za odabir modela.

Pravilo koje drži račun razumnim: zadano koristite najmanji model koji prolazi vašu evaluaciju za zadatak, a eskalirajte samo na signalima da je mali model izvan svoje dubine — niska pouzdanost, dvosmislen zahtjev, radnja s visokim ulogom. Dvorazinski sustav nije kompromis; to je način na koji dobivate vrhunsku kvalitetu ondje gdje se računa i ekonomiju malog modela svugdje drugdje.

U čemu su mali modeli uistinu dobri

ZadatakPrikladnost malog modela
Klasifikacija i usmjeravanjeIzvrsno — označavanje, razvrstavanje i raspoređivanje tiketa, e-pošte i dokumenata u velikom opsegu i uz nizak trošak.
Ekstrakcija i strukturiranjeIzvrsno — izvlačenje polja iz računa, obrazaca i ugovora u čisti JSON.
SažimanjeSnažno — sažimanje poziva, niti i izvještaja; eskalirajte samo nijansirane.
Odgovori iz dohvata (RAG)Snažno — uz dobar dohvat koji ga hrani, mali model dobro odgovara na utemeljena pitanja.
Višekoračno agentsko zaključivanjeOgraničeno — planiranje koje vodi dugu agentsku petlju i dalje favorizira vrhunski model.
Novo, otvoreno rješavanje problemaOgraničeno — uistinu teško zaključivanje ondje je gdje granica i dalje opravdava svoju cijenu.

Ekonomija, konkretno

Zamislite podršku koja mjesečno obrađuje milijun AI-potpomognutih interakcija. Usmjeravanje svake na vrhunski model obranjivo je po kvaliteti, a neobranjivo po trošku. Usmjerite 80% rutinskih — status narudžbe, resetiranje lozinke, provjere pravila — na mali model, a rezervirajte granicu za 20% koje su uistinu zahtjevne, i miješani trošak dramatično pada dok je kvaliteta prema korisniku nepromijenjena ondje gdje je važno.

Miješani mjesečni trošak inferencije — samo granica vs dvorazinski usmjerivač

Gdje su zamke

Praktično uvođenje u 90 dana

  1. Tjedni 1–2: popišite svoje AI pozive i označite svaki po težini. Većina timova otkrije da su glavnina rutinski — prirodni dom za mali model.
  2. Tjedni 3–6: postavite mali model na svoj rutinski zadatak najvećeg volumena, izgradite evaluacijski skup i dokažite da dostiže vašu trenutnu kvalitetu prije preusmjeravanja prometa.
  3. Tjedni 7–10: dodajte usmjerivač koji eskalira pozive niske pouzdanosti ili visokog uloga na vrhunski model i izmjerite miješani trošak i kvalitetu u odnosu na polazište.
  4. Tjedni 11–13: za opterećenja kritična po latenciji ili privatnosti pilotirajte implementaciju na uređaju ili unutar mreže i uspostavite ažuriranje i nadzor prije skaliranja.

Zaključak

Granica i dalje ima važnost — ondje živi najteže zaključivanje i ondje se prvo dokazuju sljedeće sposobnosti. No 2026. je jasno pokazala da se većina poslovne vrijednosti hvata ispod granice, modelima dovoljno jeftinima i brzima da rade svugdje. Timovi koji ove godine pobjeđuju s AI-em nisu oni koji plaćaju najveći model na svakom pozivu; oni su ti koji svaki zadatak uparuju s najmanjim modelom koji prelazi prag, a cijenu granice troše samo ondje gdje mijenja odgovor. Manje je, na većini mjesta koja su važna, jednostavno bolje inženjerstvo.

Izgradite AI sustav koji je brz, privatan i pristupačan

Pomažemo timovima projektirati dvorazinske arhitekture — mali modeli za volumen, vrhunski modeli za teške pozive i implementaciju na uređaju ondje gdje latencija i privatnost to zahtijevaju — uz evaluaciju koja dokazuje da svaki izbor zaslužuje svoje mjesto.

Razgovarajte s AI konzultantom