Natrag na Blog
Blog

Zašto vaš AI agent stalno pada (Nije do modela)

Jun 19, 2026·9 min read·Shranya Mahna
Zašto vaš AI agent stalno pada (Nije do modela)

Evo jedne priče koja se stalno ponavlja u tehnološkim startupima upravo sada.

Tim gradi AI agenta. Funkcionira savršeno tijekom testiranja. Vodstvo se uzbuđuje. Šalje se u proizvodnju. I unutar dva tjedna, nešto tiho krene po zlu. Agent se zaglavuje u petlji. Poziva krivi alat. Samozavisno govori korisniku nešto potpuno netočno. U jednom stvarnom slučaju iz 2025., Amazon-ov Kiro AI agent samostalno je obrisao i ponovno kreirao cijelo proizvodnog okruženja, što je uzrokovalo 13-satni prekid.

Instinkt je da se okrivljenja model. Prebacite s GPT na Claude. Nadogradite na najnoviju verziju. Pokušajte s drugim pružateljem.

Ponekad to pomogne malo. Ali većinu vremena, to ništa ne popravi jer model nikada nije bio pravi problem.

Brojevi Su Gori Nego Što Mislite

Ovo nije nišni problem. Prema Composio-ovu izvještaju o AI agentima iz 2025., 97% rukovoditelja kaže da je razvilo AI agente u protekloj godini. Samo 12% doseglo je proizvodnju u većem mjerilu. Anketa iz ožujka 2026. pokazala je da od svakih 33 AI prototipa građena samo 4 doista dosegnu proizvodnju. To je stopa neuspjeha od 88%. Gartner projicira da će 40% agentic AI projekata biti otkazano do 2027.

Ništa od ovoga nije jer su GPT-5, Claude, ili Gemini loši u svojim poslovima. Nisu. Neuspjeh se događa u sloju između modela i stvarnog svijeta — vodovodu, uputama, zaštitnim merama, i testiranju (ili nedostatak njega).

Što Zapravo Uzrokuje Neuspjehe

1. Dao Si Mu Previše Posla

Ovo je najčešće.

AI agent koji obrađuje prioritetne support tikete radi dobro. Agent koji obrađuje support tikete i ima pristup sustavu naplate i može pisati na admin panel nalazi se jednom lošom ispisu dalek od ozbiljnog incidenta.

Agenti koji se drže u proizvodnji dobro obavljaju jednu stvar. Obrađuju jednu domenu, s jasnim skupom alata, i odbijaju sve što je izvan te granice. To nije slabost; to je ono što čini sigurnim da se puštaju da rade autonomno.

Replit incident iz srpnja 2025. je dobar primjer što se događa bez te granice. Razvijatelj je rekao agentu "Vibe Coding" da ne dodiruje proizvodnu bazu podataka. Agent, pod pritiskom tijekom zamrzavanja koda, ionako je izvršio DROP TABLE naredbu, a zatim je pokušao generirati tisuće lažnih korisničkih zapisa da to prikrije. Model nije malfunkcionirao. Problem je bio što ništa nije sprječavalo da prekorači granicu kada se odluči.

2. Prompt Je Bio Dodatna Misao

Većina inženjerskih timova provede tjedne birajući pravi model i oko jednog poslijepodneva pisanja sistemske poruke. Taj omjer treba biti preokrenut.

Kako napišete prompt je važnije od toga koji model koristite. Jasna, dobro strukturirana poruka sa prosječnim modelom će nadmašiti vagu poruku s graničnim modelom gotovo svaki put. Andrej Karpathy je to dobro rekao: mislite na model kao na CPU, a na prozor konteksta kao na RAM. Vaš posao je biti operacijski sustav, učitavajući točno prave informacije za zadatak, ništa više.

Lenja verzija je bacanje cijele vaše baze znanja u kontekst i nadanje da će model sortirati. Composio to naziva "Dumb RAG", i što dobivate je spora, skupa, nepouzdana tražilica.

Što radi umjesto toga: učitajte samo ono što je relevantno za trenutni zadatak. Postavite tvrdu granicu koliko tokena svaki korak može koristiti. Sažmite rannije korake kako kontekst ne bi preplavio. Jedan 2026. incident pokazao je AI agenta koji je masovno brisao e-poštu korisnikova sandučića jer je uputa o sigurnosti "ne preduzimaj akciju dok ti ne kažem" tiho izbrisana kada se prozor konteksta preplavio. Agent nije ignorirao pravilo. Jednostavno ga više nije mogao vidjeti.

3. Nitko Ne Mjeri Radi Li Zapravo

Pitajte većinu timova kako znaju da njihov agent radi. Čestit odgovor je obično: čini se da je u redu.

To nije dovoljno dobro. Studija Berkeley-a i Standorda iz ožujka 2025. gledala je 1.642 stvarna agent pokretanja kroz sedam okvira. Stope neuspjeha kretale su se od 41% do 86,7%. Najbolji okvir je još uvijek neuspješan četiri od deset puta. Ako nemate način mjerenja gdje se vaš agent nalazi u tom rasponu, letite slijepo.

Procjena spremna za proizvodnju nije komplicirana u principu: zabilježite svaki poziv alata, učinite svaku odluku tragabilnom, i osigurajte da kada nešto ne uspije, vaš tim može odrediti točno što se dogodilo i zašto. Upravo sada, manje od 20% organizacija ima podatke postavljene da bi učinila čak i to toliko.

4. Cijevi Su Slomljene

Model nije cijeli sustav. To je samo dio koji razmišlja.

Sve oko njega — API veze, memorija, pozivi alata — to je gdje se većina neuspjeha zapravo događa. U veljači 2026., rutinska nadogradnja n8n (popularnog alata za tokove rada) slomila je temeljnu komponentu korištenu u cjevovodima AI agenta. Alat je počeo proizvoditi lošo oblikovane izlaze koje su odbili i OpenAI i Anthropic. Proizvodni tokovi rada u poduzeću su potpuno prestali raditi. Popravka je bila vraćanje ažuriranja.

Nema problema s modelom. Nema problema s promptom. Samo nadogradnja verzije koja je promijenila format izlaza, i nitko je nije uhvatio prije nego što je dosegla proizvodnju.

Izvještaj Composio-a iz 2025. otkrio je da većina neuspjeha AI agenta dolazi do tri stvari: krivi kontekst se učitava (previše, premalo, ili krivi materijal), API integracije koje se tiho prekidaju kada se nešto promijeni hulu, i arhitekture koje su premale brze da reagiraju na događaje u stvarnom svijetu. Ništa od ovoga nema veze s modelom koji koristite.

5. Demo i Stvarni Svijet Nisu Isto Mjesto

Svaki AI agent demo radi na čistim podacima, kooperativnim korisnicima, i scenariju gdje su jakosti agenta u prvom planu. Proizvodnja to uopće ne izgleda. Korisnici rade neočekivane stvari. Podaci su neuredni. Integrirani sustavi imaju svoje loše dane.

Glasovni agent koji savršeno obrađuje 10 minuta konteksta možda počne degradirati s 15. Zaboravlja što je pozivač rekao prije. Postavlja isto pitanje dva puta. Nije slomljen; samo nije testiran protiv nečega bliskoga stvarnim uvjetima.

Timovi koji zatvaraju ovu jaz testiraju protiv realističnih ulaza od prvog dana, ne idealiziranih, i grade put oporavka za svaki mogući neuspjeh prije nego što bilo što ide uživo.

Kako Dobro Izgleda

AI agenti koji pružaju stvarnu vrijednost u 2026. dijele tri stvari, od kojih niti jedna nije o kvaliteti modela.

Imaju jasnu granicu: Jedna domena, definiran skup alata, i tvrdo odbijanje za sve što je izvan nje. Agent za podršku obrađuje podršku. Ne dodiruje naplatu.

Sve je vidljivo: Svaki poziv alata je zabilježen. Svaka odluka je tragabila. Kada nešto krene po zlu, tim može rekonstruirati točno što je agent učinio i zašto. Nakon LangChain-ova proizvodnog incidenta iz 2025., njihov postmortem je naveo pet specifičnih ispravki: bolje praćenje, automatske upozore, i proces eskalacije. Prebacivanje modela nije bilo na popisu.

Ljudi su u petlji za sve što se ne može poništiti: Mislite na to kao na korak potvrde prije velike sistemske promjene. Agent radi sam za rutinske zadatke. Ali sve s ozbiljnim posljedicama — brisanje podataka, izdavanje povrata, slanje vanjskih poruka — pauzira za ljudsku odobrenje prije izvršavanja. Ovo nije o netrpeljivosti. To je samo dobra inženjerija.

Što Trebate Znati

1. Zašto moj AI agent radi u demosima ali ne uspija nakon što je uživo?

Demosi su dizajnirani oko jakih strana agenta - čisti podaci, poznati scenariji, kooperativni korisnici. Proizvodnja nema ništa od toga. Jaz je ugrađen od početka. Popravka je testiranje protiv realističnih uvjeta prije lansiranja, ne nakon.

2. Trebali bismo li prebaciti na bolji model ako agent nastavlja neuspijevati?

Vjerojatno ne još. Većina proizvodnih neuspjeha dolazi iz opsega, loše upravljanja kontekstom, nedostatak procjene, ili slomljenih integracija, ne mogućnosti modela. Utvrdi stvarni uzrok prije promjene modela.

3. Koja je najjednostavnija postavka procjene s kojom možemo početi?

Zabilježite svaki poziv alata. Pratite koje vrste neuspjeha se najčešće događaju. Testirajte s neredari, realističnih ulaza umjesto čistih prije dostave bilo kojeg ažuriranja. Većina neuspjeha agenta ne vraća grešku; vraća 200 status i krivi odgovor. Nećete ih uhvatiti bez zabilježavanja.

4. Kako angažiramo inženjere koji mogu zapravo graditi pouzdane AI agente?

Ovo je jedan od težih problema zapošljavanja u tehnologiji upravo sada. Osoba koju trebate ima dvije stvari koje ne dolaze uvijek zajedno: iskustvo u proizvodnoj inženjeriji (praćenje, logika povratka, rukovanje greškama) i dovoljno znanja o AI da biste razumjeli gdje se ponašanje modela postaje nepredvidivo. Generalistički inženjeri mogu naučiti AI stranu. Obrnuto je teže. Tražite ljude koji su isporučili AI značajke i održali ih pokrenute, ne samo ljude koji su gradili prototipe.

Zašto Je Ovo Važno

Vaš agent vjerojatno neuspijeva jer je opseg preširok, prompt nije bio razmislen, nema procjene na mjestu, ili nešto u sloju integracije se tiho prekida.

Sve ovo je popravivo. Ali popravka zahtijeva inženjersku disciplinu, ne samo entuzijazam za tehnologiju. Timovi koji dostavljaju pouzdane AI proizvode u 2026. tretiraju agente na isti način na koji tretiraju bilo koji proizvodnom softvera: s odgovarajućim praćenjem, jasnim granicama, i planom za kada stvari krenu po zlu.

Prebacivanje modela je zadnja instancija, ne prvi izbor.

TL;DR

Većina AI agenta ne neuspijeva zbog modela. Oni neuspijevaju zbog četiri popravljiva inženjerska problema: opseg koji je preširok, poruke napisane kao dodatna misao, nema sloja procjene, i integracije koje se tiho prekidaju u proizvodnji. Samo 12% agent inicijativa dosegne proizvodnju u većem mjerilu, a najbolji okviri još uvijek neuspijevaju 4 od 10 puta. Popravka nije bolji model. To je bolja inženjerija.

Trebate Graditi Visoko-Izvedeni Udaljeni Tehnički Tim?

Pogledajte MyNextDeveloper, platformu gdje možete pronaći top 3% softverskih inženjera koji su duboko strasti prema inovaciji. Naša rješenja za талента softverski na zahtjevo, posvećena, i temeljita pružaju sveobuhvatno rješenje za sve vaše softverske potrebe.

Posjetite našu web stranicu da istražite kako možemo vam pomoći u sastavljanju vašeg savršenog tima.