Ricerca — pagina 6
Ricerca arXiv cs.AI
30 giu, 12:02
DynaSteer: guidare i LLM verso la verità in tempo reale
Un team di ricerca ha sviluppato DynaSteer, un framework che interviene dinamicamente sulle rappresentazioni interne dei modelli linguistici per correggerne il ragionamento prima che commettano errori. Il sistema identifica i momenti critici di incertezza e reindirizza il percorso logico del modello verso risposte più accurate. I risultati sui benchmark matematici e su task di coding mostrano miglioramenti significativi.
Ricerca arXiv cs.AI
30 giu, 11:57
RSEA: agenti AI che imparano da soli senza rischi di regressione
Un nuovo framework chiamato RSEA permette agli agenti basati su LLM di migliorarsi autonomamente tra un'esecuzione e l'altra, riscrivendo le proprie strategie senza toccare i pesi del modello. La chiave è un meccanismo di selezione rigoroso che accetta solo gli aggiornamenti che non peggiorano le prestazioni su dati di validazione separati. I test su quattro benchmark diversi mostrano risultati promettenti ma anche limiti importanti da conoscere.
Ricerca arXiv cs.AI
30 giu, 11:57
LLM più affidabili: il ciclo chiuso dati-valutazione
Ricercatori propongono un metodo sistematico per collegare i fallimenti nei benchmark ai problemi nei dati di addestramento degli LLM. Il cuore dell'approccio è la 'capability slice', un'unità di analisi che permette di diagnosticare debolezze specifiche e intervenire in modo mirato. Due casi pratici dimostrano che il metodo funziona anche quando la soluzione non è nei dati.
Ricerca arXiv cs.AI
30 giu, 11:57
AI e bombe: nessun modello supera il test GPTNT
Un nuovo benchmark sfida i modelli multimodali a collaborare in tempo reale per disinnescare bombe virtuali nel videogioco Keep Talking and Nobody Explodes. Il risultato è impietoso: nessun sistema attuale riesce a completare anche solo un livello. Il banco di prova mette in luce limiti profondi nella collaborazione tra agenti AI sotto pressione.
Ricerca arXiv cs.AI
29 giu, 20:00
AI-ModelNet: la rete Internet dei modelli AI è realtà
Un gruppo di ricercatori propone AI-ModelNet, un'architettura che vuole fare per i modelli di intelligenza artificiale ciò che Internet ha fatto per i computer: metterli in rete per condividere capacità e collaborare. Il progetto nasce dalla necessità concreta di abbattere i costi e le complessità legate ai grandi modelli linguistici.
Ricerca arXiv cs.AI
29 giu, 20:00
ODYSSEY: modelli AI verificabili con logica categoriale
Un gruppo di ricercatori ha presentato ODYSSEY, un framework categoriale per costruire modelli fondazionali verificabili che preservano la coerenza locale della conoscenza. Il sistema si basa su strutture matematiche chiamate 'foundry' e sarà oggetto di un tutorial di 2,5 ore all'ICML 2026.
Ricerca arXiv cs.AI
29 giu, 20:00
Agenti AI che pensano al futuro: arriva il World Model Planning
Un nuovo paradigma di training permette agli agenti LLM di simulare internamente le conseguenze delle proprie azioni prima di agire, colmando il divario tra reattività e pianificazione strategica. Il sistema si articola in tre fasi successive che trasformano un modello linguistico standard in un agente capace di ragionamento prospettico genuino. I risultati superano i baseline esistenti su compiti di ricerca e ragionamento matematico.
Ricerca arXiv cs.AI
29 giu, 20:00
AI e dislessia: un framework LLM analizza le esperienze reali
Un gruppo di ricercatori ha sviluppato DysLexLens, un sistema basato su LLM a basso consumo di risorse capace di analizzare le discussioni online di persone con dislessia sull'uso degli strumenti AI. Il framework trasforma post rumorosi dai forum in dati strutturati e verificabili, aprendo nuove strade per comprendere bisogni reali spesso ignorati dalla letteratura accademica.
Directory completa

Tool AI catalogati

Tutti gli strumenti di intelligenza artificiale che abbiamo recensito e catalogato.

Vedi tutti →