Mixture-of-Experts (MoE) 2026: Zašto veliki modeli koriste samo dio sebe
Jedna od najčudnijih činjenica o modernom AI-ju jest da mnogi "veliki" modeli koje koristite zapravo ne pokreću cijeli svoj mozak za svaku riječ. Model može isticati stotine milijardi parametara, a za pojedini token upaliti samo mali dio njih. Taj trik ima ime — Mixture-of-Experts — i tiha je arhitektura iza velikog dijela brzih i jeftinih frontier modela 2026. Evo što je to, jednostavnim rječnikom, i zašto je važno svakome tko odlučuje što pokrenuti u produkciji.
Model sastavljen od specijalista
Tradicionalni "gusti" (dense) model uključuje svaki parametar za svaki token — cijela mreža okida i za riječ "i" i za suptilnu pravnu klauzulu. Mixture-of-Experts model umjesto toga dijeli dijelove mreže na mnogo paralelnih pod-mreža zvanih eksperti — zamislite ih kao specijaliste koji sjede jedan do drugoga. Za svaki token mala, naučena komponenta zvana usmjerivač (router ili gating mreža) bira samo nekoliko eksperata koji će ga obraditi, a ostale ignorira. Model i dalje sadrži sve eksperte; samo mu se ne isplati pokretati ih sve odjednom.
Zašto se itko time bavi
Veći modeli su općenito pametniji — ali plaćati pokretanje svakog parametra za svaki token postaje razorno skupo. MoE prekida tu vezu. Dobivate kapacitet znanja golemog modela uz trošak pokretanja mnogo manjega, jer se po tokenu aktivira tek djelić mreže. Zato su mnogi frontier i open-weight modeli 2026. — uključujući velik dio Mistralove ponude i drugih vodećih otvorenih izdanja — rijetki (sparse) MoE dizajni, a ne gusti. To je isti instinkt učinkovitosti kao kod destilacije, samo pristupljen sa strane arhitekture.
Kako token prolazi kroz usmjerivač
Mehanika je jednostavnija nego što žargon sugerira. Kad token dođe do MoE sloja, usmjerivač boduje svakog eksperta, zadržava nekoliko najboljih (recimo, dva najbolja) i šalje token samo njima. Njihovi se izlazi miješaju, ponderirani prema pouzdanosti usmjerivača, i prosljeđuju dalje. Usmjerivač se uči zajedno sa svim ostalim, pa s vremenom nauči koji eksperti dobro obrađuju koju vrstu ulaza.
- Usmjeri. Gating mreža boduje eksperte za ovaj token.
- Odaberi. Zadrži top-k (često 2); ostali ostaju uspavani.
- Izračunaj. Pokreću se samo odabrani eksperti — tu je ušteda na računanju.
- Spoji. Pomiješaj njihove izlaze prema ponderima usmjerivača i nastavi.
Kvaka: jeftino za računati, skupo za držati
MoE nije besplatan ručak, i vrijedi razumjeti kompromis prije nego pretpostavite da "rijetko = jeftinije za nas". Ističu se dva troška. Prvo, memorija: iako se po tokenu pokreće samo nekoliko eksperata, svi moraju biti u memoriji spremni za poziv, pa rijetki model treba daleko više VRAM-a nego što njegov broj aktivnih parametara sugerira. Drugo, uravnoteženje opterećenja: ako usmjerivač stalno favorizira iste popularne eksperte, ostali ostaju nedovoljno istrenirani, a hardver stoji besposlen, pa trening koristi dodatne trikove za raspodjelu opterećenja. Za većinu timova praktičan je zaključak jednostavan — MoE modeli su izvrsni za korištenje preko API-ja, ali teži za samostalno hostanje nego što njihova aktivna veličina sugerira.
| Dimenzija | Gusti (dense) model | MoE (rijetki) model |
|---|---|---|
| Računanje po tokenu | Svi parametri rade | Rade samo neki eksperti — puno jeftinije |
| Memorija za posluživanje | Proporcionalna veličini | Visoka — svi eksperti moraju biti učitani |
| Kapacitet znanja | Ograničen onime što si možete priuštiti pokretati | Vrlo visok za utrošeno računanje |
| Složenost posluživanja | Jednostavna | Treba usmjeravanje i uravnoteženje eksperata |
Što to znači za kupce, ne samo za graditelje
Gotovo nikad ne birate "MoE" kao kvačicu — birate model, a njegova je arhitektura detalj implementacije. No to objašnjava obrazac koji možete iskoristiti. Kad pružatelj nudi model koji je iznimno jeftin i brz za svoju prividnu veličinu, MoE je često razlog, i to je dobra vijest: preko API-ja dobivate snažnu kvalitetu po euru. Nijansa se javlja čim razmislite o samostalnom hostanju zbog rezidentnosti podataka ili troška — tamo ukupan broj parametara i njegov memorijski otisak znače daleko više od laskavog "aktivnog" broja. Pročitajte obje brojke prije nego što odredite proračun za GPU.
Zaključak
Mixture-of-Experts je industrijski odgovor na tvrdo ograničenje: inteligencija raste s veličinom, ali pokretanje svakog parametra za svaki token ne raste s vašim proračunom. Pretvarajući monolitnu mrežu u sobu punu specijalista i budeći samo prave za svaki token, MoE isporučuje kvalitetu velikog modela uz trošak pokretanja malog — što je upravo razlog zašto tolik dio frontiera 2026. živi na ovoj arhitekturi. Samo zapamtite zvjezdicu: jeftino za računati nije isto što i jeftino za držati, a razlika između ukupnih i aktivnih parametara je mjesto gdje se krije stvarni trošak posluživanja.
Niste sigurni koja arhitektura modela odgovara vašem radnom opterećenju?
Pomažemo timovima odabrati pravi model — gusti ili MoE, API ili samostalno hostanje — procijeniti stvarni trošak računanja i memorije te ga implementirati uz riješenu EU rezidentnost podataka, kroz Anthropic, OpenAI, Mistral i open-weight stackove.
Razgovarajte s AI konzultantom