Boris Agatić · · 9 min čitanja

Predmemoriranje upita i optimizacija troškova AI-ja 2026: smanjite račun za tokene bez gubitka kvalitete

Većina timova koji traže jeftiniji AI gleda na krivo mjesto. Uspoređuju cijene po tokenu među dobavljačima, jure za manjim modelom ili pregovaraju o popustu — a najveću uštedu ostavljaju na stolu. U 2026. najsnažnija poluga za vaš AI račun nije koji model zovete, nego koliko svakog upita plaćate da se iznova obradi. Predmemoriranje upita omogućuje modelu da ponovno iskoristi skupi, ponavljajući dio vašeg upita — sistemske upute, alate, dokument, primjere — umjesto da ga čita iznova pri svakom pozivu. Dobro iskorišteno smanjuje ulazne troškove i do desetak puta i istovremeno ubrzava odgovore. Evo kako radi, što stvarno štedi i cijeli plan optimizacije troškova koji se gradi oko toga.

Gdje novac zapravo odlazi

AI poziv naplaćuje se u dva smjera: ulazni tokeni koje šaljete (vaš upit) i izlazni tokeni koje model generira. Za većinu stvarnih aplikacija — agente, chatbotove utemeljene na dokumentima, pomoćnike za kodiranje, RAG cjevovode — ulaz daleko nadmašuje izlaz. Dugačak sistemski upit, velik skup definicija alata, dohvaćeni dokument i nekoliko primjera mogu biti tisuće tokena; odgovor modela često je nekoliko stotina. I ključno, većina tog ulaza jednaka je od poziva do poziva. Iste upute, isti alati, ista baza znanja — iznova poslani, iznova pročitani i iznova naplaćeni pri svakoj izmjeni.

~90%
popusta na predmemorirane ulazne tokene naspram čitanja iznova, kod pogotka u predmemoriji
do 85%
niža latencija kad se velik stabilni prefiks poslužuje iz predmemorije
80%+
ulaznih tokena u tipičnoj agentskoj ili RAG petlji je ponovljeni, predmemorabilni kontekst

Što je predmemoriranje upita

Predmemoriranje upita pohranjuje internu obradu dijela vašeg upita kako bi se ponovno iskoristila u kasnijim pozivima koji počinju istim tim dijelom. Označite stabilni prefiks — sve što se ne mijenja između zahtjeva — i dobavljač ga predmemorira. Prvi poziv plaća malu premiju da zapiše predmemoriju; svaki sljedeći poziv koji počinje tim identičnim prefiksom čita ga natrag uz velik popust umjesto da ga iznova obrađuje token po token. Promjenjivi rep upita — novo korisnikovo pitanje, zadnja izmjena — obrađuje se normalno.

Mehanizam je jednostavan, ali ograničenje je bitno: predmemoriranje radi na osnovi točnog prefiksa. Predmemorirani dio mora biti bajt-po-bajt identičan i mora se nalaziti na početku upita. Promijenite jedan znak pri vrhu i sve nakon njega promašuje predmemoriju. Ta jedna činjenica diktira kako biste trebali poredati upit.

Poredajte upit od najstabilnijeg prema najpromjenjivijem. Stavite na prvo mjesto ono što se nikad ne mijenja — sistemske upute, definicije alata, dugačke referentne dokumente, few-shot primjere — a zatim ono što se mijenja pri svakom pozivu — povijest razgovora, korisnikovu zadnju poruku. Stabilna glava postaje pogodak u predmemoriji; samo mali, svježi rep naplaćuje se po punoj cijeni. Obrnete li taj redoslijed, predmemoriranje vam donosi gotovo ništa.
Trošak ulaznih tokena po pozivu — s predmemorijom i bez nje (ilustrativno)

Ekonomija: zašto se učinak gomila

Predmemoriranje izgleda kao skroman popust po pozivu, a ispada da je strukturna promjena vaše krivulje troškova. Zamislite agenta s 10.000 tokena stabilnog konteksta (upute, alati, dokument znanja) koji vodi razgovor od 20 izmjena. Bez predmemoriranja plaćate obradu tih 10.000 tokena dvadeset puta — 200.000 ulaznih tokena čistog ponavljanja. S predmemoriranjem punu cijenu plaćate jednom da ga zapišete, a zatim djelić cijene devetnaest puta. Što je stabilni kontekst duži i što je više izmjena po sesiji, ušteda je dramatičnija — a to je upravo profil agentskih, višekružnih, na dokumentima utemeljenih radnih opterećenja koja dominiraju 2026.

Radno opterećenjeStabilni, predmemorabilni udioTipična ušteda na ulazu
Višekružni chatbot s fiksnim sistemskim upitomVisokVelika
Agent koji šalje alate + upute pri svakom korakuVrlo visokVrlo velika
RAG nad stabilnim, često upitivanim dokumentomVisokVelika
Jednokratna, jednokružna klasifikacijaNizakMinimalna

Predmemoriranje je jedna poluga — evo cijelog kompleta

Predmemoriranje upita najsnažniji je potez, ali stvarna disciplina troškova koristi nekoliko poluga zajedno. Cilj nikad nije "trošiti manje" apstraktno — nego najniži trošak koji i dalje zadovoljava vaš prag kvalitete. Ovo su potezi koji su bitni, otprilike po snazi.

Poluge optimizacije troškova prema tipičnoj snazi (ilustrativno)

Metrika koja je bitna: trošak po uspješnom zadatku

Najčešća pogreška u računanju troškova je optimiziranje cijene tokena umjesto cijene ishoda. Ono što posao plaća jest riješena prijava, točna ekstrakcija, spojeni pull request — ne milijun tokena. Model koji je 40% jeftiniji po tokenu, ali podbaci u četvrtini slučajeva, prisiljavajući na ponovne pokušaje, predaje ljudima i doradu, uopće nije jeftiniji. Uvijek podijelite ukupnu potrošnju s brojem uspješno dovršenih zadataka. To jedno preokvirivanje ubija većinu lažnih ušteda o kojima si timovi umišljaju — i to je broj koji ide uz svaki ROI slučaj.

Ilustrativna mjesečna AI potrošnja — prije i poslije optimizacije

Na što paziti

Predmemoriranje je gotovo besplatan novac, ali nekoliko oštrih rubova zna uloviti timove. Predmemorije istječu — stabilni prefiks koji nekoliko minuta ostane neiskorišten se izbacuje, pa nagli, niskofrekventni promet ima manje koristi od stabilnog prometa. Zapis u predmemoriju košta malu premiju, pa je predmemoriranje prefiksa koji koristite samo jednom neto gubitak; predmemorirajte ono što ćete ponovno koristiti. Bilo kakva promjena pri vrhu poništava sve ispod nje, pa dinamički vremenski žig ili niz specifičan po korisniku pogrešno stavljen na početak upita tiho uništava vašu stopu pogodaka. I predmemoriranje nikad ne popravlja napuhani upit — prvo podrežite, pa predmemorirajte ostatak. Instrumentirajte stopu pogodaka predmemorije kao i svaku produkcijsku metriku; predmemorija koju ne vidite je predmemorija kojoj ne možete vjerovati.

Optimizirajte ono što možete izmjeriti. Pratite ulazne naspram izlaznih tokena, stopu pogodaka predmemorije, trošak po uspješnom zadatku i tokene po sesiji kao prvorazredne produkcijske metrike. Gotovo svaki tim koji "ne može spustiti troškove AI-ja" jednostavno ne vidi kamo tokeni odlaze. Vidljivost dolazi prva; uštede slijede. To je ista disciplina kao nadzorljivost agenata — ne možete poboljšati broj koji ne pratite.

Zaključak

Jeftiniji AI u 2026. inženjerski je ishod, ne nabavni. Timovi koji ekonomično pokreću velika opterećenja nisu oni koji su našli najnižu cijenu na naljepnici — nego oni koji su prestali plaćati iznova obradu istog konteksta pri svakom pozivu. Poredajte upite stabilni-dio-prvo i predmemorirajte prefiks; prilagodite veličinu modela koraku; podrežite kontekst i ograničite izlaz; i sudite o svemu po trošku po uspješnom zadatku. Učinite to i ista aplikacija koja je bila preskupa za skaliranje postaje udobno profitabilna — uz brže odgovore kao bonus. Predmemoriranje upita je mjesto gdje se počinje, jer je najveća poluga s najmanje mane.

Smanjite AI račun bez gubitka kvalitete

Revidiramo stvarna AI opterećenja, otkrivamo kamo tokeni odlaze i preslagujemo upite, predmemoriju i usmjeravanje modela tako da ista kvaliteta košta djelić današnjeg — i dokazujemo uštedu prije nego što skalirate.

Razgovarajte s AI savjetnikom