Ultime notizie — pagina 9
Ricerca arXiv cs.AI
1 lug, 14:47
AI per trovare modelli di simulazione: ecco come funziona
Un nuovo studio sperimentale esplora come l'intelligenza artificiale possa aiutare a individuare modelli di simulazione riutilizzabili attraverso query in linguaggio naturale. I ricercatori hanno testato diversi approcci basati su embedding e strategie di recupero semantico, ottenendo risultati incoraggianti anche con modelli open-source.
Ricerca arXiv cs.AI
30 giu, 12:02
AI medica: arriva il benchmark per le conversazioni cliniche
Un team di ricercatori ha presentato IMCBench, il primo benchmark che valuta i modelli multimodali di linguaggio in conversazioni mediche multi-turno con immagini cliniche reali. Il sistema testa sicurezza, accuratezza e gestione dell'incertezza diagnostica. Claude Opus 4.6 guida la classifica, ma nessun modello eccelle su tutti i fronti.
Business Google AI Blog
30 giu, 12:02
Google punta sull'AI per rilanciare la produttività britannica
Google UK ha pubblicato il suo ultimo rapporto sull'impatto economico dell'intelligenza artificiale nel Regno Unito, delineando una strategia per rendere i benefici dell'AI accessibili a un numero sempre maggiore di persone e aziende. L'iniziativa mira a trasformare la Gran Bretagna in un hub di innovazione AI a livello europeo. Un segnale importante anche per il dibattito italiano sul ruolo dell'AI nella crescita economica.
Ricerca arXiv cs.AI
30 giu, 12:02
DynaSteer: guidare i LLM verso la verità in tempo reale
Un team di ricerca ha sviluppato DynaSteer, un framework che interviene dinamicamente sulle rappresentazioni interne dei modelli linguistici per correggerne il ragionamento prima che commettano errori. Il sistema identifica i momenti critici di incertezza e reindirizza il percorso logico del modello verso risposte più accurate. I risultati sui benchmark matematici e su task di coding mostrano miglioramenti significativi.
Ricerca arXiv cs.AI
30 giu, 11:57
RSEA: agenti AI che imparano da soli senza rischi di regressione
Un nuovo framework chiamato RSEA permette agli agenti basati su LLM di migliorarsi autonomamente tra un'esecuzione e l'altra, riscrivendo le proprie strategie senza toccare i pesi del modello. La chiave è un meccanismo di selezione rigoroso che accetta solo gli aggiornamenti che non peggiorano le prestazioni su dati di validazione separati. I test su quattro benchmark diversi mostrano risultati promettenti ma anche limiti importanti da conoscere.
Ricerca arXiv cs.AI
30 giu, 11:57
LLM più affidabili: il ciclo chiuso dati-valutazione
Ricercatori propongono un metodo sistematico per collegare i fallimenti nei benchmark ai problemi nei dati di addestramento degli LLM. Il cuore dell'approccio è la 'capability slice', un'unità di analisi che permette di diagnosticare debolezze specifiche e intervenire in modo mirato. Due casi pratici dimostrano che il metodo funziona anche quando la soluzione non è nei dati.
Ricerca arXiv cs.AI
30 giu, 11:57
AI e bombe: nessun modello supera il test GPTNT
Un nuovo benchmark sfida i modelli multimodali a collaborare in tempo reale per disinnescare bombe virtuali nel videogioco Keep Talking and Nobody Explodes. Il risultato è impietoso: nessun sistema attuale riesce a completare anche solo un livello. Il banco di prova mette in luce limiti profondi nella collaborazione tra agenti AI sotto pressione.
Ricerca arXiv cs.AI
29 giu, 20:00
AI-ModelNet: la rete Internet dei modelli AI è realtà
Un gruppo di ricercatori propone AI-ModelNet, un'architettura che vuole fare per i modelli di intelligenza artificiale ciò che Internet ha fatto per i computer: metterli in rete per condividere capacità e collaborare. Il progetto nasce dalla necessità concreta di abbattere i costi e le complessità legate ai grandi modelli linguistici.
Directory completa

Tool AI catalogati

Tutti gli strumenti di intelligenza artificiale che abbiamo recensito e catalogato.

Vedi tutti →