L’IA generativa fa imparare meglio? Una meta-analisi mostra perché la domanda è troppo semplice
In breve
L’IA generativa fa imparare meglio? Una recente meta-analisi sugli apprendimenti nelle discipline STEM mostra che la domanda è troppo semplice. Gli effetti osservati variano enormemente tra gli studi e il vantaggio medio diventa molto piccolo e incerto quando si considera il possibile bias di pubblicazione. Il punto decisivo è un altro: “usare l’IA” può significare svolgere attività cognitive profondamente diverse. Per capire gli effetti sull’apprendimento dobbiamo quindi chiederci che cosa lo studente delega alla macchina, che cosa continua a fare personalmente e quali nuove attività cognitive l’interazione con l’IA mette in movimento.
Una delle domande che accompagnano l’ingresso dell’intelligenza artificiale nella scuola è apparentemente molto semplice:
usare l’IA generativa migliora l’apprendimento?
Cominciano ormai a esserci abbastanza ricerche empiriche per tentare di rispondere. Ma proprio quando gli studi diventano numerosi, emerge un problema interessante: forse la domanda è formulata male.
Il 25 agosto 2026 è stata pubblicata su Artificial Intelligence Review la revisione sistematica e meta-analisi “Evidence of impact and interpretational limits of generative AI in STEM education: a systematic review and meta-analysis on cognitive learning outcomes”, di Chiara Boolzen, Jochen Kuhn, Salome Flegr e colleghi.
Lo scopo dello studio è valutare le evidenze disponibili sugli effetti cognitivi dell’uso della GenAI nell’educazione STEM, cercando non soltanto di stabilire se esista mediamente un effetto positivo, ma anche di capire perché gli effetti cambino così tanto da uno studio all’altro, quali difficoltà incontrino gli studenti nell’interazione con questi sistemi e quali condizioni didattiche possano rendere l’uso dell’IA più efficace.
La conclusione più importante, a mio avviso, non è che l’IA faccia bene o male all’apprendimento.
È che “usare l’IA generativa” non descrive un trattamento pedagogico sufficientemente preciso.
Gli effetti osservati sono infatti estremamente variabili: in alcune condizioni fortemente positivi, in altre modesti, nulli o negativi. Inoltre, quando gli autori correggono statisticamente il possibile bias di pubblicazione, il vantaggio medio attribuibile alla GenAI diventa molto piccolo e incerto.
Rimane però intatta l’enorme variabilità fra le diverse situazioni.
Questo sposta radicalmente il problema. La domanda interessante non è più soltanto:
L’IA fa imparare meglio?
Diventa:
Che cosa fa lo studente quando usa l’IA? Che cosa continua a fare personalmente, che cosa delega alla macchina e quale attività cognitiva viene eliminata, mantenuta o introdotta dall’interazione con essa?
È precisamente su questo terreno che la ricerca empirica sull’IA incontra alcune questioni pedagogiche molto più antiche della stessa IA.
Che cosa hanno studiato
Gli autori hanno condotto una revisione sistematica della letteratura sugli effetti della GenAI nell’educazione STEM.
La ricerca bibliografica, aggiornata al 7 maggio 2026, ha individuato 85 studi ammissibili. Per poter entrare nella meta-analisi, tuttavia, gli studi dovevano possedere caratteristiche metodologiche che consentissero un confronto quantitativo.
Alla fine sono stati utilizzati 49 studi, dai quali sono stati ricavati 59 effect sizes.
Gli studi dovevano riguardare interazioni degli studenti con sistemi di IA generativa, comprendere una condizione di confronto o controllo e misurare risultati cognitivi dell’apprendimento.
È un aspetto importante.
Non stiamo parlando semplicemente della percezione degli studenti, della soddisfazione nell’uso di ChatGPT, della velocità con cui riescono a svolgere un compito o della qualità apparente del prodotto realizzato.
L’oggetto della ricerca è l’apprendimento cognitivo misurato attraverso valutazioni esterne.
La letteratura disponibile presenta tuttavia già un limite: riguarda prevalentemente studenti dell’istruzione superiore e sistemi generativi testuali. Sarebbe quindi prematuro generalizzare automaticamente i risultati a tutti i livelli scolastici.
A prima vista l’IA sembra funzionare
La meta-analisi convenzionale restituisce complessivamente un effetto positivo della GenAI sull’apprendimento nelle discipline STEM.
Ci si potrebbe fermare qui e concludere:
l’evidenza scientifica mostra che utilizzare l’IA migliora l’apprendimento.
Ma sarebbe proprio la conclusione che lo studio invita a non trarre.
Il primo segnale d’allarme è l’eterogeneità dei risultati.
Gli autori trovano:
I² = 96,32%.
È un valore altissimo.
Significa che gli studi non stanno semplicemente osservando lo stesso effetto con normali oscillazioni sperimentali. Le differenze fra i risultati sono enormi.
Lo conferma un altro dato particolarmente eloquente.
L’intervallo di previsione degli effetti va da:
Hedges’ g = –1,52 a +3,20.
Dentro lo stesso insieme di ricerche troviamo quindi la possibilità di effetti fortemente negativi e di effetti straordinariamente positivi.
Dire che «mediamente la GenAI produce un effetto positivo» rischia allora di nascondere il fenomeno pedagogicamente più interessante:
perché in alcune situazioni funziona molto bene e in altre no?
Il problema del bias di pubblicazione
Gli autori individuano inoltre segnali di un possibile publication bias (gli studi che trovano risultati positivi, forti o statisticamente significativi hanno maggiori probabilità di essere pubblicati rispetto agli studi che trovano effetti piccoli, nulli o negativi).
È un problema classico della ricerca scientifica: gli studi che trovano risultati positivi o statisticamente significativi hanno maggiori probabilità di essere pubblicati rispetto agli studi che non trovano effetti.
Di conseguenza, osservando soltanto la letteratura pubblicata, potremmo ottenere un’immagine eccessivamente favorevole dell’efficacia di un intervento.
Gli autori applicano quindi una Robust Bayesian Meta-Analysis, una procedura che permette di tenere conto anche di questa possibilità.
E il quadro cambia considerevolmente.
Dopo la correzione, la stima dell’effetto medio diventa:
μ = 0,076 ± 0,254.
In altre parole, il vantaggio medio diventa molto piccolo e fortemente incerto.
Questo risultato non autorizza a concludere che l’IA non aiuti ad apprendere.
Dice una cosa diversa e più prudente:
le evidenze attualmente disponibili non permettono di attribuire alla semplice presenza della GenAI un beneficio cognitivo generale e stabile.
Ma rimane un fatto da spiegare
La correzione del bias ridimensiona fortemente l’effetto medio, ma non elimina un altro risultato fondamentale: la straordinaria variabilità degli effetti.
L’eterogeneità rimane molto elevata.
Ed è probabilmente qui che lo studio diventa pedagogicamente più interessante.
Se l’IA producesse sempre più o meno lo stesso effetto, potremmo cercare di misurarne l’efficacia come facciamo con un trattamento relativamente definito.
Ma «usare GenAI» può voler dire cose completamente diverse.
Uno studente può chiedere:
«Risolvimi questo problema».
Un altro può presentare la propria soluzione e chiedere:
«Trova gli errori nel mio ragionamento».
Un altro ancora può chiedere spiegazioni alternative, esempi, controesempi, obiezioni, confrontare risposte, verificare informazioni e modificare progressivamente la propria rappresentazione del problema.
Tutti e tre, nella descrizione più generale dell’esperimento, potrebbero risultare studenti che “usano GenAI”.
Ma dal punto di vista cognitivo stanno svolgendo attività profondamente differenti.
Non basta sapere che è stata usata l’IA
Gli autori cercano quindi di individuare alcune variabili capaci di spiegare le differenze fra gli studi.
Una riguarda il tipo di apprendimento:
acquisizione di conoscenze oppure sviluppo di abilità.
Un’altra riguarda invece qualcosa di ancora più interessante: come cambia l’attività cognitiva dello studente quando viene introdotta l’IA.
Per analizzarlo utilizzano il modello ISAR — Inversion, Substitution, Augmentation, Redefinition, mettendolo in relazione con il framework ICAP — Interactive, Constructive, Active, Passive.
Il punto importante non è qui entrare nei dettagli dei due modelli, ma comprendere il cambio di prospettiva.
Non si confrontano soltanto:
attività senza IA → attività con IA.
Si cerca di confrontare:
che cosa deve fare cognitivamente lo studente senza IA → che cosa deve fare cognitivamente lo studente quando utilizza l’IA.
La tecnologia smette così di essere la variabile pedagogica fondamentale.
La variabile diventa la trasformazione dell’attività cognitiva prodotta dall’introduzione della tecnologia.
Sostituire o aumentare l’attività dello studente?
Da questa analisi emerge una distinzione particolarmente importante.
Gli effetti sembrano più promettenti quando la GenAI viene utilizzata per aumentare, arricchire o trasformare l’attività dello studente, mentre possono diventare problematici quando l’IA sostituisce l’attività cognitiva che lo studente avrebbe dovuto svolgere personalmente.
È una distinzione semplice solo in apparenza.
L’IA può infatti ridurre enormemente il lavoro necessario per svolgere un compito.
Ma non tutto il lavoro scolastico ha lo stesso valore cognitivo.
Eliminare un’attività meccanica, ripetitiva o scarsamente significativa può liberare risorse per attività cognitive più importanti.
Eliminare invece il ragionamento, la ricerca delle relazioni, la formulazione delle ipotesi, la costruzione di una spiegazione o il controllo della correttezza può significare eliminare proprio il processo attraverso il quale avrebbe dovuto avvenire l’apprendimento.
Il problema, quindi, non è semplicemente quanto lavoro venga delegato.
È:
quale lavoro viene delegato e che cosa rimane da fare cognitivamente allo studente.
Un grande effetto non dimostra necessariamente la superiorità dell’IA
Lo studio contiene anche un’avvertenza metodologica molto interessante.
Gli autori individuano numerosi studi con effetti molto grandi, ma osservano che in diversi casi le attività cognitive svolte dal gruppo sperimentale e dal gruppo di controllo non erano realmente equivalenti.
Supponiamo che un gruppo di studenti studi con strumenti tradizionali mentre un altro utilizza un tutor generativo progettato per fornire spiegazioni, feedback, esempi, domande e suggerimenti personalizzati.
Se il secondo gruppo ottiene risultati molto migliori, l’effetto può essere perfettamente reale.
Ma che cosa abbiamo dimostrato?
Che l’IA è intrinsecamente più efficace?
Oppure che abbiamo collocato un gruppo di studenti dentro un ambiente didattico molto più ricco?
Un grande effect size può quindi essere statisticamente corretto e contemporaneamente richiedere molta prudenza nella sua interpretazione pedagogica.
Conoscenze e abilità
Un altro risultato riguarda la distinzione fra acquisizione di conoscenze e sviluppo di abilità.
Dei 23 effect sizes classificati come grandi, 19 riguardano apprendimenti orientati alla conoscenza e soltanto 4 apprendimenti orientati alle abilità.
Complessivamente, nei 41 casi orientati alla conoscenza, 19 mostrano grandi effetti; nei 18 orientati alle abilità, soltanto 4.
La GenAI sembra quindi mostrare risultati particolarmente promettenti quando viene utilizzata nell’acquisizione di conoscenze.
Ma anche qui bisogna evitare una conclusione troppo rapida.
Non tutti gli interventi orientati alla conoscenza producono grandi effetti. Il tipo di apprendimento è quindi una parte della spiegazione, non la spiegazione.
Abbiamo spiegato soltanto una piccola parte delle differenze
Ed eccoci forse al risultato più interessante per la ricerca futura.
Le variabili individuate dagli autori riescono a spiegare soltanto una parte modesta dell’enorme differenza fra gli studi.
Il tipo di apprendimento e il livello ISAR spiegano separatamente circa il 12,5% e il 13% della variabilità.
Considerati insieme arrivano a circa il 18,66%.
Rimane quindi oltre l’80% della variabilità da spiegare.
Non sappiamo ancora abbastanza bene perché in alcune condizioni l’interazione con la GenAI produca effetti molto positivi e in altre no.
E proprio qui gli autori indicano alcune variabili che la ricerca attuale misura ancora troppo poco.
Tra queste:
- AI literacy degli studenti;
- capacità metacognitive;
- modalità di delega del compito;
- qualità del prompting;
- comportamenti di verifica delle risposte.
L’elenco è significativo.
Perché ci porta molto lontano dalla semplice domanda:
«Gli studenti hanno usato IA?»
e molto più vicino a domande come:
Che cosa gli hanno fatto fare? Con quali conoscenze pregresse? Che cosa hanno delegato? Come hanno interrogato la macchina? Hanno controllato le risposte? Con quali criteri? Che cosa hanno rielaborato personalmente?
Forse stiamo misurando una variabile troppo grossolana
Questa meta-analisi suggerisce quindi un problema più generale nella ricerca educativa sull’intelligenza artificiale.
“Uso della GenAI” potrebbe essere una categoria sperimentale troppo grossolana.
Pensiamo a due studenti.
Il primo chiede all’IA di svolgere un compito, prende la risposta e la consegna.
Il secondo formula una prima risposta autonomamente, la confronta con quella dell’IA, chiede obiezioni, ricerca controesempi, verifica le informazioni, modifica il proprio ragionamento e infine ricostruisce personalmente la risposta.
Entrambi hanno usato la stessa tecnologia.
Forse hanno persino utilizzato lo stesso modello linguistico.
Ma pedagogicamente non hanno fatto la stessa cosa.
E probabilmente non hanno nemmeno svolto la stessa quantità e qualità di lavoro cognitivo.
Un aggancio con le questioni che stiamo esplorando in questo blog
Questa ricerca incontra direttamente alcune questioni che sto affrontando in altri articoli sull’IA a scuola.
Una è la distinzione tra delega produttiva e delega sostitutiva: non si tratta di difendere ogni attività tradizionalmente svolta dallo studente, ma di capire quali attività possano essere affidate alla macchina senza eliminare i processi cognitivi necessari alla comprensione e all’apprendimento.
Un’altra riguarda la distinzione fra uso povero e uso ricco dell’IA.
La differenza non sta nella sofisticazione dello strumento e neppure necessariamente nella qualità del prodotto finale. Sta soprattutto in ciò che l’uso dello strumento mette in movimento nella persona.
Uno studente può produrre con l’IA un elaborato eccellente avendo pensato pochissimo. Può anche utilizzare la stessa IA per mettere continuamente alla prova ciò che pensa, incontrare prospettive differenti, individuare errori e riformulare le proprie idee.
Il prodotto potrebbe persino essere meno spettacolare.
L’attività cognitiva potrebbe essere enormemente maggiore.
Ed emerge anche la questione del lavorare di più o di meno con l’IA.
La domanda, forse, non dovrebbe essere:
quanto lavoro risparmia l’IA?
ma:
quale lavoro risparmia?
Se riduce il lavoro esecutivo e contemporaneamente permette di aumentare quello di analisi, confronto, verifica e rielaborazione, abbiamo una determinata configurazione didattica.
Se elimina proprio il lavoro cognitivo attraverso il quale si apprende, ne abbiamo una completamente diversa.
Dalla domanda sull’IA alla domanda sull’attività cognitiva
La ricerca di Boolzen e colleghi non dimostra che l’IA generativa migliori l’apprendimento.
Ma non dimostra neppure il contrario.
Ci dice qualcosa di forse più utile.
Gli effetti osservati sono talmente differenti da rendere poco informativa una domanda formulata semplicemente in termini di presenza o assenza dell’IA.
Il problema pedagogico sembra trovarsi altrove.
Dobbiamo sapere come viene utilizzata, per quale compito, da quale studente, con quali conoscenze, con quale supporto didattico e soprattutto quale attività cognitiva viene richiesta alla persona prima, durante e dopo l’interazione con la macchina.
Da questo punto di vista possiamo formulare una conclusione provvisoria:
Sapere che uno studente ha usato l’IA ci dice ancora troppo poco per sapere che cosa ha fatto cognitivamente e, quindi, per prevedere che cosa abbia imparato.
Forse è questa una delle indicazioni più importanti che possiamo ricavare dalla ricerca empirica disponibile.
La domanda «l’IA fa imparare meglio?» non va semplicemente risposta.
Va resa più complessa.
E la domanda successiva potrebbe essere molto più pedagogicamente produttiva:
Quando introduciamo l’IA in un’attività di apprendimento, che cosa smette di fare lo studente, che cosa continua a fare e che cosa comincia a fare che prima non avrebbe potuto fare?
È probabilmente lì, molto più che nella tecnologia in sé, che dovremo cercare gli effetti dell’intelligenza artificiale sull’apprendimento.

