L’AI ci fa davvero risparmiare tempo? Come leggere i dati sulla produttività
Tra esperimenti, questionari e sensazioni personali emergono risultati diversi. Per capirli bisogna osservare il lavoro completo, comprese verifiche e correzioni.
Un testo compare in pochi secondi. Una funzione viene generata mentre descriviamo il problema. La velocità è evidente, ma la produttività richiede una domanda ulteriore: quanto lavoro utile abbiamo completato, e con quale qualità?
È una delle questioni aperte nel dibattito sull’AI del 2026. Studi diversi sembrano talvolta contraddirsi. Spesso, però, osservano persone, attività e strumenti differenti. In altri casi cambia proprio ciò che viene misurato: tempo effettivo, percezione individuale o valore del risultato.
Il risultato del 2025 che continua a essere citato
Nel luglio 2025 METR ha pubblicato uno studio su sviluppatori esperti impegnati nei propri progetti open source. Sedici partecipanti hanno affrontato 246 attività, assegnate casualmente a condizioni con o senza strumenti AI.
In quel contesto, l’accesso all’AI ha aumentato il tempo necessario del 19%. Dopo l’esperimento, i partecipanti stimavano invece di essere stati circa il 20% più veloci. Lo studio evidenziava quindi anche una distanza tra percezione e misura.
Il risultato riguarda quel campione e gli strumenti della prima parte del 2025. Non dimostra che qualsiasi uso dell’AI rallenti qualsiasi persona. Fonte: lo studio sperimentale di METR.
Perché il seguito del 2026 è più difficile da interpretare
Il 24 febbraio 2026 METR ha spiegato di voler cambiare il disegno dell’esperimento successivo. Un problema riguardava la selezione: alcuni sviluppatori non volevano partecipare se questo significava lavorare senza AI. Altri evitavano di proporre attività per le quali si aspettavano un grande vantaggio dagli strumenti.
I ricercatori ritengono plausibile un aumento dei benefici rispetto al primo studio. Dichiarano però che i nuovi dati forniscono un’indicazione poco affidabile sulla dimensione dell’effetto. Il cambiamento nel compenso e la difficoltà di misurare attività svolte con agenti paralleli complicano ulteriormente il confronto. Fonte: l’aggiornamento metodologico di METR.
La lettura corretta evita due scorciatoie: trattare il dato del 2025 come una legge permanente oppure presentare il seguito come una prova definitiva del contrario. L’incertezza dichiarata dai ricercatori fa parte del risultato.
Che cosa aggiungono i questionari
Nel maggio 2026 METR ha pubblicato anche un’indagine su 349 lavoratori tecnici. Le risposte indicano un aumento mediano percepito del valore del lavoro compreso tra 1,4 e 2 volte, secondo la misura utilizzata.
Si tratta di autovalutazioni raccolte su un campione non rappresentativo dell’intera popolazione lavorativa. Gli autori discutono esplicitamente la possibilità di sovrastime. Un questionario aiuta a capire esperienze e aspettative, ma non misura direttamente un effetto causale. Fonte: l’indagine METR sul lavoro tecnico.
Questo rende le due forme di ricerca complementari. Una osserva tempi in condizioni definite; l’altra raccoglie ciò che le persone riferiscono sul proprio lavoro. Confondere le domande porta a confrontare numeri che descrivono cose differenti.
Il conto completo: prima versione, verifica, correzione
Proviamo a ragionare con un esempio inventato. Preparare una relazione richiede normalmente 80 minuti. Con l’AI, la prima versione arriva in 15 minuti. Seguono però 35 minuti di verifica delle fonti e 20 di riscrittura. Il totale è 70 minuti: il risparmio è di 10 minuti.
In un secondo caso ipotetico, il testo generato richiede soltanto 10 minuti di revisione. Il totale scende a 25 minuti. La stessa velocità di generazione può quindi corrispondere a benefici finali molto diversi.
Questi numeri non provengono da uno studio e non sono una previsione. Servono a mostrare perché suggeriamo di misurare l’intero percorso. Fermare il cronometro alla prima bozza esclude proprio il lavoro necessario per renderla utilizzabile.
Nel conteggio includeremmo anche il tempo di preparazione: raccogliere documenti, spiegare il contesto e definire la richiesta. Se una procedura viene riutilizzata, quel costo iniziale può essere distribuito su più attività. Per una richiesta occasionale, pesa invece tutto sul singolo risultato.
Velocità e utilità possono muoversi diversamente
Immaginiamo ora di generare dieci varianti di una presentazione. Se ne servivano due, produrne altre otto potrebbe aggiungere soprattutto tempo di selezione. Se invece il confronto tra alternative migliora una decisione importante, lo stesso lavoro aggiuntivo potrebbe avere valore.
La nostra interpretazione è che un conteggio di output sia incompleto senza un criterio di utilità. Pagine scritte, immagini create o righe di codice descrivono una quantità. Non spiegano, da sole, se qualcuno abbia risolto meglio il problema iniziale.
Per questo, in una prova, definiremmo prima che cosa significa “finito”. Una relazione pronta da condividere? Una modifica verificata? Un riepilogo che conserva tutti i punti essenziali? Rendere esplicito questo criterio aiuta a evitare confronti tra una bozza e un risultato realmente utilizzabile.
Una piccola prova, impostata con criterio
Per un confronto orientativo sul proprio lavoro, proponiamo di scegliere un’attività ricorrente e delimitata. Per esempio: riassumere documenti dello stesso tipo, con lunghezza e difficoltà simili. Non sarebbe uno studio scientifico, ma potrebbe offrire informazioni più utili di una singola impressione.
La prova dovrebbe registrare almeno:
- Tempo totale: preparazione, esecuzione, controllo e correzioni.
- Qualità finale: valutata con gli stessi criteri nei due percorsi.
- Errori rilevanti: informazioni mancanti, inesatte o non verificabili.
- Intervento umano: quante decisioni e quante revisioni sono state necessarie.
È utile conservare anche i tentativi non riusciti. Se si confronta il miglior esempio con AI con una giornata normale senza AI, il risultato diventa poco informativo.
Eviteremmo inoltre di ripetere lo stesso documento prima senza strumenti e poi con strumenti. Nel secondo tentativo, conoscere già il contenuto potrebbe incidere sul tempo. Documenti distinti ma comparabili aiutano a ridurre questa ambiguità, senza eliminarla del tutto.
Quali conclusioni possiamo trarre
I risultati disponibili invitano a specificare sempre chi usa l’AI, per quale attività, con quali strumenti e in quale periodo. Una conclusione valida per sviluppatori esperti su progetti conosciuti non descrive automaticamente chi sta imparando o svolge un lavoro diverso.
La nostra posizione è che la produttività vada discussa a partire da risultati verificati e contesti espliciti. La sensazione di lavorare meglio è un’informazione utile da raccogliere. Affiancarla a tempi, qualità e correzioni permette però di capire dove il beneficio esiste davvero.
Il dato interessante, alla fine di una prova, è quanto lavoro utilizzabile rimane dopo i controlli. È da lì che può partire un confronto concreto sul ruolo dell’AI nelle attività quotidiane.
Aggiornato al 23 settembre 2026. Gli studi sono distinti per data e metodologia. Gli esempi numerici e la proposta di prova sono elaborazioni editoriali, non risultati sperimentali.