Natrag na Blog
Blog

Što je slom modela i zašto je problem za AI

Jul 3, 2026·7 min read·Shranya Mahna
#AI#Content#Hallucinations#Model Collapse#Startup
Što je slom modela i zašto je problem za AI

Trenutno se na internetu događa čudna petlja.

AI alati stvaraju sadržaj. Taj sadržaj se objavljuje online. Web skraperi ga prikupljaju. AI modeli se treniraju na njemu. Ti modeli stvaraju još sadržaja. Skraperi ga ponovno prikupljaju.

Svakim ciklus, nešto postaje malo gore. Rezultati postaju blaži. Nišno znanje počinje nestajati. Razumijevanje svijeta modela tiho se sužava.

Ovo je kolaps modela, i nije budući rizik; već se događa.

Što je zapravo kolaps modela?

Kolaps modela je ono što se događa kada AI model neprekidno trenira na sadržaju koji je sam stvoren AI-om.

Termin je došao iz istraživačkog rada iz 2023. godine pod nazivom "The Curse of Recursion" od istraživača uključujući Iliju Shumailjova iz Google DeepMind-a. Njihov rad, kasnije objavljen u Nature, pokazao je jasan uzorak: kada AI modeli treniraju na AI-generiranim podacima ponavljajući, degradiraju se. Svjetonazor modela se sužava. Rijetke ili neobične informacije nestaju prve. Odgovori se kreću prema sigurnim, prosječnim odgovorima. Na kraju, nakon dovoljno ciklusa, izlazi prestaju biti smisleni u potpunosti.

Zamislite fotokopirator koji pravi kopije kopija. Prva izgleda dobro. Do desete generacije, detalji su zamućeni, i nešto bitno je izgubljeno. U AI-u, to nešto bitno je raznolikost, cijeli spektar ljudskog znanja, rubnih slučajeva, nijansirani stavovi. Kada ti počnu nestajati iz podataka za treniranje, nestaju i iz odgovora modela.

Zašto se to događa sada?

Jer je internet punjen AI-generiranim sadržajem mnogo brže nego što većina ljudi spoznaje.

Ahrefs je analizirao gotovo milijun novopubliciranih web stranica u travnju 2025. i otkrio da je 74,2% sadržavalo detektabilan AI-generirani sadržaj. Odvojena studija od 65 000 članaka otkrila je da su AI-napisani članci kratko vremenske nadmašili ljudski napisane u kasnom 2024. Europol je procijenio da bi do 2026. do 90% online sadržaja moglo biti sintetski generirano.

Istodobno, ponuda kvalitetnog ljudski napisanog teksta za treniranje se sužava. AI laboratoriji su već skrapirali većinu upotrebljive javne interneta. Sljedeća generacija modela će neizbježno trenirati na više sintetskog sadržaja — ne po izboru, već jer je to sve više ono od čega se web sastoji.

Rezultat je povratna petlja: AI trenira na AI-generiranim podacima, koji su tretirani na ranijim AI-generiranim podacima, svaki krug kompresira i ravna ono što je došlo prije njega.

Kako zapravo izgleda?

Znakovi nisu dramatični. To je dio onoga što ga čini teško primjetiti.

U srpnju 2025., Reddit korisnik je primijetio nešto čudno: deseci blog postova o kvantnom računanju su se pojavili na različitim web stranicama, svi citirajući isti članak iz revije, koji nije postojao. Postovi su bili dobro napisani i samouvereni. Većina je bila AI-generirana. Nisu kopirali jedni druge. Nezavisno su halucinirali istu lažnu citaciju jer su svi crpili iz istog oslabljenog bazena podataka.

To je kolaps modela u divljini. Ne pojavljuje se kao loša engleska ili očiti greške. Pojavljuje se kao ponavljanje, lažna samouverenija, i tiho erodiranje dubine.

Istraživanje opisuje proces u dvije faze. Prvo, rijetke i nišne informacije počinju nestajati, dug rep znanja koji se ne pojavljuje u većini dokumenata. Zatim, šire, izlazi gube koherentnost. Studija iz 2025. godine od Apple-a otkrila je da veliki modeli razmišljanja dosežu ono što studija naziva "potpuni kolaps točnosti" na složenim zadacima nakon rekurzivnog treniranja. Zabrinjavajući dio: neuspjeh se nije pojavio u testovima standardnih mjerila jer su ta mjerila sama sadržavala AI-generirani sadržaj.

Zašto bi startupe i graditelje trebao brinuti?

Jer su alati koje gradite nizvodno od ovog problema.

Ako su AI modeli koji opskrbljuju vaš proizvod tretirani na degradiranim, petljastim sintetskim podacima, to se pokazuje u vašim rezultatima. U alatu za kodiranje, to znači samouvereno pogrešne prijedloge na rubnim slučajevima. U chatbotu, to znači poliran odgovore koji su suptilno pogrešni. U alatu za podatke, to znači rezultate koji izgleda dobro ali propuštaju neobične obrasce koji zapravo važni.

Postoji i specifičan rizik za timove koji stvaraju sadržaj u mjerilu: blog postove, opise proizvoda, odgovore podrške. Ako je taj sadržaj indeksiran i skrapiran natrag u buduće skupove podataka za treniranje, vaši izlazi postaju dio petlje. Ne konzumirate samo sintetske podatke. Hraniš ga natrag.

Drugi problem je mjerenje. Model koji prolazi kroz kolaps može i dalje proći standardne testove performansi dok tiho degradira u stvarnom svijetu, jer testovi sami mogu sadržavati AI-generirani sadržaj. Objavljene ocjene točnosti ne će ga uvijek uhvatiti.

Je li to neizbježno?

Ne, ali izbjegavanje zahtijeva namjernu napor.

Studija iz 2024. godine pod nazivom "Is Model Collapse Inevitable?" pronašla je jasan odgovor: kolaps se događa kada sintetski podaci zamjene stvarne podatke svaki krug treniranja. Kada se sintetski podaci dodaju uz originalne ljudski-generirane podatke umjesto da ih zamjene, modeli ostaju stabilni. Ključ je nikad ne dozvoljiti stvarnim podacima da budu izbrisani iz smjese.

Nekoliko stvari koje zapravo pomažu:

  • Zadržite ljudski-generirane podatke u smjesi: Istraživačke institucije i organizacije poput Internet Archive-a aktivno čuvaju pre-AI web sadržaj iz tog razloga. Neke tvrtke grade vlastite ljudski-napisane cjevovode podataka kroz suradnje izdavača.
  • Pratite gdje dolaze vaši podaci: Porijeklo podataka — znati što je ljudski napisano naspram AI-generirano — postaje ozbiljan dio odgovornog AI razvoja, ne samo dodatak.
  • Koristite ljudsku povratnu informaciju tijekom treniranja: Integriranje ljudske recenzije u fino podešavanje pomaže da se modeli ponovno poravnaju sa stvarnosvjetskim znanjem i hvata rubne slučajeve koje sintetski podaci tiho brišu.
  • Filtrirajte prije nego što trenira: Nisu svi sintetski podaci nanose istu štetu. Sadržaj generirani s kontrolom kvalitete degradira modele daleko manje od masovnog, nefiltriranog izlaza. Problem je neselektivna skala, nije sam sintetski sadržaj.

Odgovorimo na pitanja

1. Utječe li kolaps modela na AI alate koje koristim danas?

Moguće na marginama. Najnoviji frontalni modeli su uglavnom tretirani prije eksplozije sintetskog sadržaja i aktivno ga filtriraju. Ali kako se skupovi podataka za treniranje ažuriraju s više nedavnih web podataka, rizik raste, posebno za manje ili fino podešene modele koji se oslanjaju na nedavne skrapere.

2. Je li kolaps modela isto kao halucinacija?

Povezano, ali drugačije. Halucinacija je kada model proizvodi samouvereno pogrešne rezultate, nešto što bilo koji model može učiniti. Kolaps modela je strukturni, generacijski problem uzrokovan rekurzivnim treningom na sintetskim podacima. Kolaps obično čini halucinacije gore i teže za otkrivanje tijekom vremena.

3. Što mogu startupe koji gradi AI proizvode učiniti u vezi s tim?

Ne koristite AI-generirani sadržaj kao podatke za fino podešavanje bez filtriranja kvalitete. Zadržite ljudski pregledani skup podataka za bilo koji trening specifičan za domenu. Testirajte performanse protiv realističnih rubnih slučajeva, nije čistih mjerila. I pitajte davatelje modela temelja na kojima gradite koje su njihove prakse filtriranja podataka za treniranje zapravo.

Kratka verzija

Kolaps modela je dugoročna cijena kratkoročne pogodnosti. Stvaranje AI sadržaja u mjerilu je lako. Održavanje raznolikosti i dubine ljudskog znanja na kojem su modeli izgrađeni je mnogo teže.

Za bilo koga koji gradi s AI-om, praktični zaključak je jednostavan: kvaliteta onoga što isporučujete je samo toliko dobra koliko su podaci koji dolaze u modele ispod njega. Podaci za treniranje su infrastruktura. Zaslužuju biti tretirani kao takvi.

TL;DR

AI modeli se treniraju na podacima o internetu. Internet je sada sve više pun AI-generiranog sadržaja. Dakle, noviji modeli se treniraju na AI rezultatima, koji su tretirani na ranijim AI rezultatima, i svaki krug, kvaliteta tiho degradira. Rijetko znanje nestaje prvo. Odgovori postaju blaži i manje pouzdani. Ovo je kolaps modela, i već se pojavljuje u divljini. Ispravka nije komplicirana: zadržite stvarne ljudske podatke u smjesi za treniranje, nemojte dozvoliti sintetskom sadržaju da ga izbriše, i tretirajte kvalitetu podataka kao infrastrukturu koju zapravo jest.

Želite izградити visokoizvedljiv udaljeni tehnički tim?

Provjerite MyNextDeveloper, platformu gdje možete pronaći top 3% softverskih inženjera koji su duboko strastveni o inovacijama. Naša dostupna, dedicirana i temeljita rješenja za softverske talente pružaju sveobuhvatan pristup svim vašim softverskim zahtjevima.

Posjetite naš web-site da biste istražili kako vam možemo pomoći pri sastavljanju vašeg savršenog tima.