Der er en mærkelig løkke, der finder sted på internettet lige nu.
AI-værktøjer genererer indhold. Det indhold bliver publiceret online. Webscrapere indsamler det. AI-modeller trænes på det. Disse modeller genererer mere indhold. Scraperne indsamler det igen.
Med hver cyklus bliver noget lidt værre. Resultater bliver mere fade. Nicheknoledge begynder at forsvinde. Modellens forståelse af verden bliver stille og roligt smallere.
Dette er modelkollaps, og det er ikke en fremtidig risiko; det sker allerede.
Hvad er modelkollaps præcis?
Modelkollaps er det, der sker, når en AI-model fortsætter med at træne på indhold, som selv blev skabt af AI.
Begrebet kom fra et 2023-forskningsartikel kaldet "The Curse of Recursion" af forskere, herunder Ilia Shumailov på Google DeepMind. Deres arbejde, der senere blev publiceret i Nature, viste et klart mønster: når AI-modeller trænes på AI-genereret data gentagne gange, degenereres de. Modellens verdensopfattelse bliver smallere. Sjælden eller usædvanlig information forsvinder først. Svar driver mod sikre, gennemsnitlige svar. Til sidst, efter nok cyklusser, holder outputs helt op med at give mening.
Tænk på en fotokopimaskine, der laver kopier af kopier. Den første ser fint ud. Ved tiende generation er detaljerne uskarpe, og noget væsentligt er gået tabt. I AI er det væsentlige diversity – hele spektret af menneskelig viden, kanttilfælde, nuancerede synspunkter. Når disse begynder at forsvinde fra træningsdataene, forsvinder de også fra modellens svar.
Hvorfor sker dette nu?
Fordi internettet fyldes med AI-genereret indhold meget hurtigere end de fleste mennesker indser.
Ahrefs analyserede næsten en million nyligt publicerede websider i april 2025 og fandt, at 74,2% indeholdt påviseligt AI-genereret indhold. En separat undersøgelse af 65.000 artikler fandt, at AI-skrevne artikler kortvarigt overtalte menneske-skrevne i slutningen af 2024. Europol har estimeret, at op til 90% af onlineindhold kunne være synttetisk genereret i 2026.
Samtidig bliver udbuddet af højkvalitets menneskeskrevet tekst til træning mindre. AI-labs har allerede skrabet det meste af det brugbare offentlige internet. Den næste generation af modeller vil uundgåeligt træne på mere syntetisk indhold – ikke efter valg, men fordi det er i stigende grad, hvad internettet består af.
Resultatet er en tilbagekoblingsløkke: AI træner på AI-genereret data, som blev trænet på tidligere AI-genereret data, hver runde komprimerer og flader det, der kom før.
Hvordan ser det egentlig ud?
Tegn på kollapsen er ikke dramatiske. Det er en del af det, der gør det svært at få øje på.
I juli 2025 bemærkede en Reddit -bruger noget mærkeligt: dusinvis af blogindlæg om kvantecomputing var dukket op på forskellige websites, alle citerende den samme tidsskriftsartikel – en der ikke eksisterede. Indlæggene var velskrevne og selvsikre. De fleste var AI-genererede. De havde ikke kopieret hinanden. De havde uafhængigt hallucineret samme falske henvisning, fordi de alle havde trukket fra den samme udtyndede datapool.
Det er modelkollaps i det vilde. Det viser sig ikke som dårlig engelsk eller åbenlyse fejl. Det viser sig som gentagelse, falsk selvtillid og den stille udhuling af dybde.
Forskning beskriver processen i to stadier. Først begynder sjælden og nicheoplysning at forsvinde – den lange hale af viden, der ikke optræder i de fleste dokumenter. Derefter mister resultater mere bredt sammenhæng. Et 2025 Apple-studie fandt, at store ræsonnementsmodeller ramte hvad studiet kaldte "komplet nøjagtighedskollaps" på komplekse opgaver efter rekursiv træning. Den bekymrende del: fejlslaget viste sig ikke i standardbenchmarktests, fordi disse benchmarks selv indeholdt AI-genereret indhold.
Hvorfor bør startups og bygmestre bekymre sig?
Fordi værktøjerne, du bygger med, er downstream fra dette problem.
Hvis AI-modellerne bag dit produkt blev trænet på degraderet, sløjfede syntetisk data, viser det sig i dine resultater. I et kodningsværktøj betyder det selvfølgelig forkerte forslag på kanttilfælde. I en chatbot betyder det polerede svar, der er subtilt forkerte. I et dataværktøj betyder det resultater, der ser fine ud, men mister de usædvanlige mønstre, der faktisk betyder noget.
Der er også en specifik risiko for teams, der genererer indhold i stor skala: blogindlæg, produktbeskrivelser, supportresponser. Hvis det indhold bliver indekseret og skrabet tilbage i fremtidige træningsdatasæt, bliver dine resultater en del af løkken. Du forbruger ikke bare syntetisk data. Du fodrer det tilbage.
Den anden problem er benchmarking. En model, der gennemgår kollaps, kan stadig bestå standardydelsestests, mens den stilfærdigt degenererer i den virkelige verden, fordi selve testene kan indeholde AI-genereret indhold. Publicerede nøjagtighedsresultater fanger det ikke altid.
Er det uundgåeligt?
Nej, men at undgå det kræver bevidst indsats.
Et 2024-studie kaldet "Is Model Collapse Inevitable?" fandt et klart svar: kollaps sker, når syntetisk data erstatter virkelige data hver træningsrunde. Når syntetisk data tilføjes ved siden af de oprindelige menneskegenererede data i stedet for at erstatte det, forbliver modeller stabile. Nøglen er aldrig at lade virkelige data blive fortrængt fra mixen.
Et par ting, der faktisk hjælper:
- Hold menneskegenereret data i mixen: Forskningsinstitutioner og organisationer som Internet Archive bevarer aktivt pre-AI webindhold af denne grund. Nogle virksomheder bygger proprietære menneskeskrevne datapipelines gennem udgivelsespartnerskaber.
- Spor hvor dine data kommer fra: Dataprovenance – at vide, hvad der er menneske-skrevet versus AI-genereret – bliver en seriøs del af ansvarlig AI-udvikling, ikke blot en nice-to-have.
- Brug menneskelig feedback under træning: Integration af menneskelig gennemgang i fine-tuning hjælper med at justere modeller igen til virkelighedskendskab og fanger de kanttilfælde, som syntetisk data stille og roligt sletter.
- Filtrer før du træner: Ikke al syntetisk data forårsager samme skade. Indhold genereret med kvalitetskontroller degraderer modeller meget mindre end bulk, ufiltreret output. Problemet er udiskriminerende skala, ikke syntetisk data i sig selv.
Lad os tage fat på spørgsmålene
1. Påvirker modelkollaps de AI-værktøjer, jeg bruger i dag?
Muligvis i marginerne. De mest nylige grænsemodeller blev stort set trænet før den syntetiske indholdseksplosion og filtrerer aktivt for det. Men når træningsdatasæt opdateres med mere nyere webdata, vokser risikoen, især for mindre eller fine-tuned modeller, der trækker kraftigt fra nyere scrapes.
2. Er modelkollaps det samme som hallucination?
Relateret, men anderledes. Hallucination er, når en model producerer selvfølgelig forkerte resultater, noget enhver model kan gøre. Modelkollaps er et strukturelt, generationelt problem forårsaget af rekursiv træning på syntetisk data. Kollaps har en tendens til at gøre hallucinationer værre og sværere at opdage over tid.
3. Hvad kan startups, der bygger AI-produkter, gøre ved det?
Brug ikke AI-genereret indhold som fine-tuning data uden kvalitetsfiltrering. Behold et menneskekontrolleret datasæt til ethvert domænespecifikt træning. Test performance mod realistiske kanttilfælde, ikke rene benchmarks. Og spørg de grundmodelindbyders du bygger på, hvad deres praksis med træningsdatafiltrering egentlig ligner.
Den korte version
Modelkollaps er den langsigtede omkostning ved en kortsigtet bekvemmelighed. At generere AI-indhold i stor skala er nemt. At opretholde diversiteten og dybden af menneskelig viden, som modeller blev bygget på, er meget sværere.
For alle, der bygger med AI, er den praktiske takeaway enkel: kvaliteten af det, du sender, er kun lige så god som de data, der går ind i modellerne under det. Træningsdata er infrastruktur. Det fortjener at blive behandlet som sådan.
TL;DR
AI-modeller trænes på internetdata. Internettet er nu i stigende grad fyldt med AI-genereret indhold. Så nyere modeller trænes på AI-resultater, som blev trænet på tidligere AI-resultater, og hver runde degenereres kvaliteten stille og roligt. Sjælden viden forsvinder først. Svar bliver mere fade og mindre pålidelige. Dette er modelkollaps, og det viser sig allerede i det vilde. Rettelsen er ikke kompleks: hold virkelig menneskeligdata i træningen mixen, lad ikke syntetisk indhold fortrænge det, og behandl datakvalitet som den infrastruktur, det faktisk er.
Leder du efter at bygge et højresulterende fjernteam?
Tjek MyNextDeveloper, en platform, hvor du kan finde de bedste 3% af softwareingeniører, der er dybt passionerede omkring innovation. Vores on-demand, dedikerede og grundige softwaretaleentløsninger giver en omfattende løsning til alle dine softwarekrav.
Besøg vores website for at udforske, hvordan vi kan hjælpe dig med at sammensætte dit perfekte team.


