Proprio adesso su internet sta accadendo uno strano ciclo.
Gli strumenti di IA generano contenuti. Questi contenuti vengono pubblicati online. I web scraper li raccolgono. I modelli di IA si addestrano su di essi. Questi modelli generano più contenuti. Gli scraper li raccolgono di nuovo.
Ad ogni ciclo, qualcosa si degrada leggermente. Gli output diventano più banali. La conoscenza di nicchia inizia a scomparire. La comprensione del mondo del modello si restringe silenziosamente.
Questo è il collasso dei modelli, e non è un rischio futuro; sta già accadendo.
Quindi, Che Cos'è Esattamente il Collasso dei Modelli?
Il collasso dei modelli è quello che accade quando un modello di IA continua ad addestrarsi su contenuti creati a loro volta da IA.
Il termine proviene da un articolo di ricerca del 2023 intitolato "The Curse of Recursion" di ricercatori tra cui Ilia Shumailov di Google DeepMind. Il loro lavoro, successivamente pubblicato su Nature, ha mostrato un pattern chiaro: quando i modelli di IA si addestrano ripetutamente su dati generati da IA, si degradano. La visione del mondo del modello si restringe. Le informazioni rare o insolite scompaiono per prime. Le risposte tendono verso respons sicure e mediate. Eventualmente, dopo abbastanza cicli, gli output smettono di avere senso del tutto.
Pensa a una fotocopiatrice che fa copie di copie. La prima sembra va bene. Alla decima generazione, i dettagli sono sfocati e qualcosa di essenziale è andato perso. Nell'IA, quel qualcosa di essenziale è la diversità, l'intera gamma della conoscenza umana, i casi limite, i punti di vista sfumati. Una volta che questi iniziano a scomparire dai dati di addestramento, scompaiono anche dalle risposte del modello.
Perché Sta Accadendo Adesso?
Perché internet si sta riempiendo di contenuti generati da IA molto più velocemente di quanto la maggior parte delle persone realizzi.
Ahrefs ha analizzato quasi un milione di pagine web pubblicate di recente nell'aprile 2025 e ha trovato che il 74,2% conteneva contenuti rilevabilmente generati da IA. Uno studio separato di 65.000 articoli ha scoperto che i pezzi scritti da IA hanno brevemente superato quelli scritti da umani alla fine del 2024. Europol ha stimato che fino al 90% dei contenuti online potrebbe essere generato sinteticamente entro il 2026.
Allo stesso tempo, l'offerta di testo di alta qualità scritto da umani per l'addestramento si sta esaurendo. I laboratori di IA hanno già scansionato la maggior parte di internet pubblico utilizzabile. La prossima generazione di modelli si addestrerà inevitabilmente su più contenuti sintetici — non per scelta, ma perché questo è sempre più quello di cui è fatto il web.
Il risultato è un ciclo di feedback: l'IA si addestra su dati generati da IA, che erano stati addestrati su dati generati da IA precedenti, ogni round comprime e appiattisce quello che è venuto prima.
Che Aspetto Ha Effettivamente?
I segnali non sono drammatici. Questo è parte di quello che lo rende difficile da individuare.
Nel luglio 2025, un utente di Reddit ha notato qualcosa di strano: dozzine di articoli di blog sul calcolo quantistico erano apparsi su diversi siti web, tutti citando lo stesso articolo di una rivista, uno che non esisteva. I post erano ben scritti e sicuri. La maggior parte erano generati da IA. Non si erano copiati l'un l'altro. Avevano allucinato indipendentemente la stessa citazione falsa perché avevano tutti attinto dallo stesso pool di dati assottigliato.
Questo è il collasso dei modelli in natura. Non si manifesta come inglese spezzato o errori evidenti. Si manifesta come ripetizione, falsa fiducia e l'erosione silenziosa della profondità.
La ricerca descrive il processo in due fasi. Prima, le informazioni rare e di nicchia iniziano a scomparire, la lunga coda della conoscenza che non appare nella maggior parte dei documenti. Poi, più in generale, gli output perdono coerenza. Uno studio Apple del 2025 ha scoperto che i grandi modelli di ragionamento hanno riscontrato quello che lo studio ha chiamato "collasso di accuratezza completa" su compiti complessi dopo l'addestramento ricorsivo. La parte preoccupante: il fallimento non si è manifestato nei test di benchmark standard perché questi benchmark stessi contenevano contenuti generati da IA.
Perché le Startup e i Builder Dovrebbero Preoccuparsene?
Perché gli strumenti che stai costruendo sono a valle di questo problema.
Se i modelli di IA che alimentano il tuo prodotto sono stati addestrati su dati sintetici degradati e in loop, questo si manifesta nei tuoi output. In uno strumento di codifica, significa suggerimenti sicuri ma sbagliati sui casi limite. In una chatbot, significa risposte rifinite che sono leggermente sbagliate. In uno strumento di dati, significa output che sembrano a posto ma perdono i modelli insoliti che in realtà contano.
C'è anche un rischio specifico per i team che generano contenuti in scala: articoli di blog, descrizioni di prodotti, risposte di supporto. Se quel contenuto viene indicizzato e scansionato nei futuri set di dati di addestramento, i tuoi output diventano parte del ciclo. Non stai solo consumendo dati sintetici. Li stai alimentando di nuovo.
L'altro problema è il benchmarking. Un modello in corso di collasso può ancora superare i test di performance standard mentre si degrada silenziosamente nel mondo reale, perché i test stessi possono contenere contenuti generati da IA. I punteggi di accuratezza pubblicati non sempre lo cattureranno.
È Inevitabile?
No, ma evitarlo richiede uno sforzo deliberato.
Uno studio del 2024 intitolato "Is Model Collapse Inevitable?" ha trovato una risposta chiara: il collasso accade quando i dati sintetici sostituiscono i dati reali ad ogni round di addestramento. Quando i dati sintetici vengono aggiunti insieme ai dati originali generati da umani invece di sostituirli, i modelli rimangono stabili. La chiave è non lasciare mai che i dati reali vengano emarginati dal mix.
Alcune cose che effettivamente aiutano:
- Mantieni i dati generati da umani nel mix: Le istituzioni di ricerca e le organizzazioni come l'Internet Archive stanno attivamente conservando il contenuto web pre-IA per questo motivo. Alcune aziende stanno costruendo pipeline di dati proprietari scritti da umani attraverso partnership con editori.
- Traccia da dove provengono i tuoi dati: La provenienza dei dati — sapere cosa è scritto da umani rispetto a quello generato da IA — sta diventando una parte seria dello sviluppo responsabile dell'IA, non un "nice-to-have".
- Usa il feedback umano durante l'addestramento: Integrare la revisione umana nel fine-tuning aiuta a riallineare i modelli con la conoscenza del mondo reale e cattura i casi limite che i dati sintetici silenziosamente cancellano.
- Filtra prima di addestrare: Non tutti i dati sintetici causano lo stesso danno. Il contenuto generato con controlli di qualità degrada i modelli molto meno dell'output bulk e non filtrato. Il problema è la scala indiscriminata, non i dati sintetici in sé.
Affrontiamo le Domande
1. Il collasso dei modelli influisce sui tool di IA che uso oggi?
Possibilmente ai margini. I modelli di frontiera più recenti sono stati in gran parte addestrati prima dell'esplosione dei contenuti sintetici e filtrano attivamente per essa. Ma man mano che i set di dati di addestramento vengono aggiornati con dati web più recenti, il rischio cresce, soprattutto per modelli più piccoli o fine-tuned che attingono pesantemente da scansioni recenti.
2. Il collasso dei modelli è la stessa cosa dell'allucinazione?
Correlati, ma diversi. L'allucinazione è quando un modello produce output sicuri ma sbagliati, qualcosa che qualsiasi modello può fare. Il collasso dei modelli è un problema strutturale e generazionale causato dall'addestramento ricorsivo su dati sintetici. Il collasso tende a rendere le allucinazioni peggiori e più difficili da rilevare nel tempo.
3. Cosa possono fare le startup che costruiscono prodotti di IA al riguardo?
Non usare contenuti generati da IA come dati di fine-tuning senza filtraggio di qualità. Mantieni un set di dati revisionato da umani per qualsiasi addestramento specifico del dominio. Testa le prestazioni rispetto a casi limite realistici, non a benchmark puliti. E chiedi ai provider di modelli fondazionali su cui costruisci come sono in realtà le loro pratiche di filtraggio dei dati di addestramento.
La Versione Breve
Il collasso dei modelli è il costo a lungo termine di una convenienza a breve termine. Generare contenuti di IA in scala è facile. Mantenere la diversità e la profondità della conoscenza umana su cui i modelli sono stati costruiti è molto più difficile.
Per chiunque stia costruendo con l'IA, il takeaway pratico è semplice: la qualità di quello che rilasci è buona solo quanto i dati che entrano nei modelli sottostanti. I dati di addestramento sono infrastruttura. Meritano di essere trattati come tali.
TL;DR
I modelli di IA sono addestrati su dati di internet. Internet è ora sempre più pieno di contenuti generati da IA. Quindi i modelli più recenti si addestrano su output di IA, che sono stati addestrati su output di IA precedenti, e ad ogni round, la qualità si degrada silenziosamente. La conoscenza rara scompare per prima. Le risposte diventano più banali e meno affidabili. Questo è il collasso dei modelli, e sta già manifestandosi in natura. La soluzione non è complicata: mantieni i dati umani reali nel mix di addestramento, non lasciare che il contenuto sintetico li soppianti, e tratta la qualità dei dati come l'infrastruttura che effettivamente è.
Stai cercando di costruire un team tecnico remoto ad alte prestazioni?
Visita MyNextDeveloper, una piattaforma dove puoi trovare il 3% migliore di ingegneri del software che sono profondamente appassionati di innovazione. Le nostre soluzioni di talento software on-demand, dedicate e approfondite forniscono una soluzione completa per tutti i tuoi requisiti software.
Visita il nostro sito web per scoprire come possiamo aiutarti ad assemblare il tuo team perfetto.


