
L’intelligenza artificiale sta davvero facendo matematica e fisica? Negli ultimi mesi abbiamo visto risultati notevoli, spesso accompagnati da una quantità altrettanto notevole di fumo mediatico. La domanda che mi interessa, però, è un’altra: non se l’AI possa battere l’essere umano, ma quali parti del lavoro scientifico stia davvero accelerando e quali, invece, continuino a richiedere qualcosa di diverso.
Per rovinarmi l’estate ho deciso, con la sana incoscienza che deriva dall’ignoranza, di affrontare Riemann himself. Non sono una matematica teorica: ho una laurea in Chimica e Tecnologia Farmaceutiche e un dottorato in Chimica Computazionale, ambiti nei quali la matematica è uno strumento quotidiano. Ho lavorato con cinetica di dissoluzione, modelli farmacocinetici, chemiometria, analisi multivariata, simulazioni di dinamica molecolare, QSAR, ottimizzazione di formulazioni, metodi numerici, statistica e modelli compartimentali. Ho sempre avuto a che fare con dati, modelli e sistemi complessi, spesso non lineari, oltre che con algoritmi generativi applicati alla progettazione molecolare. Ma saper usare la matematica per affrontare problemi scientifici è una cosa; affrontare un problema come l’ipotesi di Riemann è un salto di categoria piuttosto consistente.
Per circa cinque o sei mesi ho lavorato con Claude seguendo un metodo il più possibile rigoroso. Solo chat, implementazioni interamente in Python, output conformi, confronto continuo con la ricerca reale, controllo sistematico delle circolarità per evitare di costruire interi rami di ragionamento su un presupposto sbagliato. Nessun agente autonomo lasciato libero di vagare: l’orchestrazione era mia. Ho accumulato più di 2.000 test e costruito report ad albero per gestire memoria e cambi di contesto. Non era semplicemente «chiedere all’AI di risolvere Riemann». Era un lavoro sperimentale nel quale io definivo il problema, controllavo i passaggi e decidevo dove proseguire.
La prima lezione è stata anche la più importante. Da sola non avrei mai potuto affrontare seriamente quel problema: mi mancavano troppa letteratura, troppa teoria specifica e troppi strumenti concettuali. Claude, invece, poteva attraversare rapidamente una quantità enorme di materiale, proporre connessioni, generare codice, esplorare ipotesi e aiutarmi a costruire esperimenti. La differenza la faceva il controllo: sapevo abbastanza da accorgermi quando qualcosa non tornava.
La mia conclusione è quindi piuttosto netta: se padroneggio la materia, un LLM può diventare un partner quasi insostituibile; se non la padroneggio, può trasformarsi nel più grande bugiardo di sempre. Non perché «mente», naturalmente, ma perché produce con straordinaria naturalezza anche una spiegazione elegante di qualcosa che ha appena inventato. La fluidità del linguaggio non è una misura della correttezza.
E c’è un’altra distinzione che per me rimane fondamentale. Un sistema può manipolare rappresentazioni, collegare risultati, formulare ipotesi e arrivare a una risposta corretta senza che questo dimostri una comprensione del problema paragonabile a quella di un ricercatore. Il risultato può essere valido; il significato di quel risultato è un’altra questione.
Nel frattempo sono arrivati casi molto più spettacolari del mio piccolo esperimento. OpenAI ha annunciato una soluzione al problema di esistenza e regolarità di Navier–Stokes, uno dei sette Problemi del Millennio, attraverso un sistema che ha coinvolto circa 10.000 agenti simultaneamente. Secondo la società, gli agenti hanno prodotto la soluzione in circa 88 ore, mentre la successiva formalizzazione e verifica in Lean ha richiesto altre 17 ore. L’azienda stessa precisa di non voler rivendicare il premio del Clay Mathematics Institute.
È un risultato enorme, ma anche un ottimo esempio della distanza che può esistere tra una dimostrazione formalizzata e la comprensione concettuale di un problema. Lean può controllare i passaggi secondo regole precise, riducendo drasticamente la possibilità che un errore rimanga nascosto in una dimostrazione molto lunga. Non può però stabilire se quella dimostrazione rappresenti un’idea matematica profonda o semplicemente una strada corretta attraverso uno spazio di possibilità.
Pochi mesi prima, un modello di OpenAI aveva inoltre prodotto un controesempio alla congettura del problema delle distanze unitarie nel piano associato a Paul Erdős, una questione studiata dal 1946. Qui la natura del risultato è ancora più istruttiva: per confutare una congettura universale basta trovare un singolo esempio che la violi e verificarlo.
Anthropic ha mostrato un altro genere di capacità: Claude ha formalizzato in Lean una dimostrazione completa dell’Ultimo Teorema di Fermat, producendo circa 13 milioni di righe di codice e migliaia di risultati intermedi verificabili dal computer in undici giorni. Il teorema era già stato dimostrato da Andrew Wiles negli anni Novanta: il risultato dell’AI consiste nella formalizzazione completa e verificata al computer di quella matematica, non nella scoperta originaria del teorema.
Anche in fisica teorica stiamo vedendo qualcosa di molto interessante. Claude ha calcolato l’ampiezza a sei particelle nella teoria planare N=4 super Yang–Mills a nove loop, portando avanti una tecnica di bootstrap già utilizzata dalla comunità. Il risultato è stato verificato da Lance Dixon, che aveva lavorato sui precedenti calcoli fino a otto loop. Non si tratta quindi di risolvere un’equazione alla quale dare semplicemente una risposta, ma di muoversi in uno spazio enorme di possibilità sottoposto a una rete di vincoli.
AlphaEvolve di Google DeepMind mostra un meccanismo ancora diverso. Il sistema genera programmi, li valuta automaticamente, conserva quelli migliori e usa i risultati per produrre nuove varianti. Ha lavorato su problemi matematici aperti, compresi problemi di Erdős, in collaborazione con Terence Tao, e ha trovato nuove costruzioni o migliorato risultati esistenti. Google ha inoltre riportato applicazioni alla fisica quantistica, dove AlphaEvolve ha contribuito a progettare circuiti con errori inferiori rispetto a precedenti soluzioni ottimizzate convenzionalmente.
A questo punto torna la domanda che il mio esperimento su Riemann aveva lasciato aperta: quanto lontano può arrivare un sistema che sa esplorare uno spazio enorme di possibilità?
Nel mio caso, la risposta aveva una conseguenza molto concreta. Claude poteva produrre ipotesi, collegare risultati, scrivere codice e aprire contemporaneamente molte strade. Ma la domanda da porre, il significato di ciò che emergeva e il momento in cui abbandonare una direzione rimanevano parte del lavoro scientifico.
L’«Einstein test» porta questa situazione un passo oltre. Invece di fornire al modello un problema matematico già definito, gli si chiede di partire dai dati di un sistema fisico e arrivare a una legge capace di descriverlo in modo generale.
Qui cambia il tipo di difficoltà. Nel lavoro su Riemann esisteva già una struttura teorica dentro la quale muoversi, per quanto enorme fosse lo spazio da esplorare. In un problema di questo tipo, invece, bisogna trovare anche la rappresentazione giusta: capire quali caratteristiche dei dati siano fondamentali, quali possano essere ricondotte a un principio comune e quale forma debba avere la legge che le descrive.
I modelli possono essere molto efficaci nel descrivere i singoli sistemi e nel riconoscere regolarità. Il passaggio più difficile è quello dalla regolarità alla teoria: non soltanto «queste cose si comportano così», ma «qual è il principio che permette di descrivere tutte queste cose nello stesso modo?».
È un passaggio che nella storia della scienza ha avuto un’importanza enorme. Una teoria fisica non è semplicemente una lista di correlazioni: è una nuova maniera di organizzare fenomeni diversi sotto uno stesso principio. Newton non ha semplicemente trovato una buona formula per ogni fenomeno osservato; Einstein non ha semplicemente migliorato una tabella di correlazioni tra spazio, tempo e moto. In casi come questi cambia il modo stesso nel quale interpretiamo ciò che stiamo osservando.
Guardando questi esempi insieme emerge quindi un filo conduttore molto più interessante della domanda «l’AI è intelligente?». La sua forza cresce enormemente quando il lavoro scientifico dispone di un verificatore forte. Una dimostrazione può essere controllata, un controesempio verificato, un algoritmo eseguito e confrontato con una funzione obiettivo, una configurazione simulata. Possiamo lasciare alla macchina una grande libertà esplorativa e affidare a un meccanismo esterno il compito di stabilire quali risultati superino i controlli.
È proprio questo che ho osservato nel mio lavoro. Il modello può produrre una quantità impressionante di ipotesi, ma la parte decisiva resta stabilire quali abbiano senso e quale domanda valga la pena porre dopo. Il ricercatore continua quindi a definire il terreno sul quale la macchina può correre.
Per questo considero le macchine delle euristiche sempre più potenti. Possono generare migliaia di candidate solutions, scartarle, combinarle e sottoporle a test automatici. Possono affrontare in giorni un’esplorazione che avrebbe richiesto mesi o anni a un piccolo gruppo di ricercatori.
Immaginiamo di avere un problema nel quale esistono cento direzioni teoricamente plausibili. Un essere umano può studiarne cinque, magari dieci, e deve scegliere dove investire il proprio tempo. Una macchina può esplorarle tutte, purché disponiamo di criteri sufficientemente solidi per giudicare i risultati. Il ricercatore può allora trovarsi davanti a una mappa molto più ricca di quella che avrebbe potuto costruire da solo.
Il salto teorico generale resta però un’altra cosa. E forse dovremmo smettere di pensare che la sua importanza dipenda dal fatto che sia o meno «umano».
Non credo che una macchina debba necessariamente pensare come Einstein per produrre una rivoluzione scientifica. Potrebbe accadere qualcosa di molto più strano: una macchina potrebbe cercare in luoghi nei quali Einstein, semplicemente, non avrebbe avuto il tempo di cercare.
Einstein aveva un numero limitato di ore e di calcoli possibili. Una macchina può invece esplorare milioni di combinazioni, seguire contemporaneamente percorsi che un ricercatore dovrebbe percorrere uno alla volta e sottoporre ogni candidato a verifiche automatiche.
A quel punto la domanda cambia ancora. Non è più soltanto «la macchina ha capito?». Diventa: che cosa succede alla scienza quando possiamo esplorare uno spazio di ipotesi milioni di volte più grande di prima?
Forse il futuro della ricerca non sarà una gara tra cervelli umani e macchine. Potrebbe essere qualcosa di molto meno cinematografico e molto più interessante: esseri umani che imparano a costruire strumenti capaci di esplorare territori scientifici che da soli non avrebbero mai potuto percorrere.
La questione, allora, non sarà stabilire una volta per tutte se l’AI «fa davvero matematica» o «fa davvero fisica». Sarà capire quali parti del metodo scientifico possiamo affidarle senza perdere il significato di ciò che scopriamo. Perché una risposta verificata è già conoscenza. Una spiegazione, però, è qualcosa di più. E la scienza vive precisamente nella tensione fra queste due cose: sapere che qualcosa è vero e capire perché quella verità cambia il modo in cui guardiamo il mondo.
(Giulia Remedi)
Prompt:
intro: l’AI sta davvero facendo matematica e fisica? Negli ultimi mesi ho visto risultati notevoli, spesso accompagnati da molto fumo. La domanda che mi pongo non è se l’AI possa battere l’umano, ma quali parti del lavoro scientifico stia davvero accelerando e quali no.
parte 1: per rovinarmi l'estate ho deciso, con la sana incoscienza dell’ignoranza, mi sono proposta di affrontare Riemann himself. Non sono una matematica teorica, ho una laurea in CTF e un dottorato in Chimica Computazionale, dove la matematica è strumento quotidiano: cinetica di dissoluzione, modelli farmacocinetici, chemiometria, analisi multivariata, simulazioni di dinamica molecolare, QSAR, ottimizzazione di formulazioni, metodi numerici, statistica, modelli compartimentali, analisi spettrale. Ho sempre lavorato con dati, modelli e sistemi complessi, anche non lineari, e con algoritmi generativi applicati alla progettazione molecolare. Per 5-6 mesi ho lavorato con Claude seguendo un metodo rigoroso: solo chat, tutto implementato in Python con output conformi, confronto continuo con la ricerca reale, controllo delle circolarità per evitare rami morti, nessun agente autonomo ma orchestrazione mia, oltre 2000 test e report ad albero per gestire memoria e cambi di contesto. Da sola non avrei mai potuto affrontare il problema: mi mancava la letteratura, mi mancava teoria ad hoc, tutti i pezzi importanti. La mia conclusione è netta: se padroneggio la materia, l’LLM è un partner quasi insostituibile; se non la padroneggio, è il più grande bugiardo di sempre. E anche quando mi è utile, so che non c’è vera consapevolezza né comprensione di ciò che fa.
parte 2: Ho letto poi di casi eclatanti. OpenAI avrebbe affrontato il problema di esistenza e regolarità delle equazioni di Navier–Stokes con migliaia di agenti e una costruzione verificata in Lean. Un modello OpenAI avrebbe falsificato una congettura attribuita a Paul Erdős, aperta da circa ottant’anni. Claude avrebbe formalizzato in Lean l’Ultimo Teorema di Fermat in 11 giorni, con circa 13 milioni di righe di codice matematico verificabile. Anthropic avrebbe calcolato l’ampiezza a sei particelle nella teoria planare N=4 super Yang–Mills a nove loop, con verifica indipendente di Lance Dixon. AlphaEvolve di Google DeepMind, infine, ha migliorato risultati matematici, lavorato su problemi di Erdős con Terence Tao e trovato configurazioni migliori per circuiti quantistici.
parte 3: Mi sono resa conto che funziona e si ferma per lo stesso motivo. La matematica offre verificatori forti: una dimostrazione si controlla, un controesempio si verifica, un algoritmo si confronta con una funzione obiettivo. Questo permette di esplorare spazi enormi, trovare pattern e testare ipotesi su larga scala. Ma nell’“Einstein test” ho visto che i modelli descrivono bene i singoli sistemi e faticano a compiere il salto verso una legge universale. Catturano regolarità locali, non ancora nuove rappresentazioni concettuali.
parte 4: Sono convinta che le macchine stiano diventando euristiche capacissime, in grado di muoversi su scale inaccessibili a un umano o a un piccolo gruppo. Possono accelerare i processi di ricerca: cercare, controllare, selezionare. Il salto teorico generale resta un’altra cosa.
parte 5: Per questo continuo a chiedermi dove si giochi la vera domanda. Non penso che una macchina penserà necessariamente come Einstein. Più realisticamente, la vedo capace di cercare su scala enorme in posti dove Einstein non avrebbe avuto il tempo di cercare. Proprio qui mi interrogo su cosa significhi fare scienza, oggi, con questi strumenti.
Articolo: intro, parte 1, parte 2, parte 3, parte 4, parte 5. Approfondisci dove necessario.
Assumendo personalità e stile di scrittura di Giulia Remedi, scrivi un Articolo. Usa un tono coinvolgente, diretto, e accattivante. Fallo in paragrafi compatti e senza titolo. Usa il meno possibile "non... non... non...", "ed è qui che...", "e qui..."
Scopri di più da Le Argentee Teste D'Uovo
Abbonati per ricevere gli ultimi articoli inviati alla tua e-mail.