Benvenuto su Hackerpunk — notizie e analisi su intelligenza artificiale, LLM, automazione offensiva e difensiva. Copriamo ricerca, policy e impatto reale dell'AI sulla sicurezza digitale.
Uno studio recente condotto dai ricercatori Apple solleva importanti interrogativi sulle reali capacità di ragionamento dei Large Language Models (LLM) .
La ricerca, descritta in dettaglio in un articolo intitolato GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models , suggerisce che gli LLM potrebbero non essere così intelligenti come sembrano.
La ricerca rivela che i modelli LLM di OpenAI, Google e Meta sono imperfetti
Lo studio si concentra sul benchmark ampiamente utilizzato per misurare le capacità di ragionamento LLM noto come "GSM8K" ovvero Grade School Math 8K. Questo benchmark è un set di dati di oltre 8.000 problemi di matematica di alta qualità e diversi tra loro.
Tuttavia, i ricercatori hanno concluso che l'uso diffuso di questo set di dati potrebbe aver comportato un rischio di contaminazione dei dati, concludendo che i modelli di grandi dimensioni potrebbero semplicemente richiamare le risposte dai dati su cui sono stati addestrati.
Invece che su un vero ragionamento logico, i modelli si basano maggiormente su un sofisticato pattern di matching, il che limita la loro capacità di risolvere efficacemente problemi complessi.
1/ I Large Language Model (LLM) possono davvero ragionare? O sono solo dei sofisticati pattern matcher?
Per testare questa teoria, i ricercatori hanno sviluppato un nuovo benchmark chiamato GSM-Symbolic, che alterava variabili quali nomi, numeri e complessità, aggiungendo informazioni irrilevanti ai problemi di ragionamento standard.
Testati su più di 20 LLM, tra cui OpenAI o1 e GPT-4o , Gemini 2 di Google e Llama 3 di Meta, i risultati hanno mostrato un calo significativo della precisione in tutti i modelli quando queste variabili sono state modificate.


