Ricerca
Ricerca
arXiv cs.AI
4 ago, 08:37
AI e matematica: LLM alla caccia di nuove congetture
Un gruppo di ricercatori ha sviluppato un sistema basato su LLM capace di generare e validare congetture matematiche di rilievo in modo automatizzato. Il pipeline in tre fasi integra ricerca esplorativa, validazione critica e verifica formale tramite Lean 4. L'obiettivo è individuare problemi aperti che potrebbero ridisegnare interi settori della matematica.
Ricerca
arXiv cs.AI
4 ago, 08:37
AI che valuta AI: il primo benchmark per i sistemi di ricerca autonoma
Un nuovo studio propone un protocollo standardizzato per confrontare i principali framework di AI Scientist, usando tre grandi modelli linguistici come revisori automatici. I risultati mostrano differenze nette tra i sistemi testati e aprono una questione metodologica importante: chi valida la ricerca generata dalle macchine?
Ricerca
arXiv cs.AI
4 ago, 08:37
AI Agentici Full-Stack: architettura autonoma con OpenClaw e Ollama
Un nuovo studio propone un'architettura a strati per sistemi di AI agentici completamente autonomi, usando OpenClaw come layer di orchestrazione e Ollama per l'inferenza LLM. La ricerca dimostra che capacità avanzate come memoria persistente e pianificazione emergono dall'integrazione sistemica, non dai singoli modelli. Codice e dataset sono rilasciati pubblicamente.
Ricerca
arXiv cs.AI
4 ago, 08:37
ThinkReset: ragionamento AI senza perdere il filo
Un team di ricerca ha sviluppato ThinkReset, un metodo che risolve uno dei limiti più concreti dei modelli AI nella risoluzione di problemi complessi: la finestra di contesto limitata. L'approccio introduce un'interfaccia intermedia riutilizzabile che permette al modello di 'resettarsi' senza perdere i progressi compiuti. I risultati mostrano miglioramenti consistenti su benchmark di ragionamento a lungo orizzonte.
Ricerca
arXiv cs.AI
28 lug, 19:06
C-VCE: spiegazioni visive AI con immagini 'what-if' interpretabili
Un nuovo framework basato su modelli di diffusione permette di generare spiegazioni contrfattuali visive guidate da concetti semantici comprensibili agli utenti. C-VCE integra il classificatore direttamente nel modello generativo, eliminando la dipendenza da classificatori esterni fragili. Il risultato sono immagini modificate in modo minimale e controllato, utili soprattutto in contesti ad alto rischio come la medicina.
Ricerca
arXiv cs.AI
28 lug, 19:06
QFoldAgent: agenti AI e quantum computing per le proteine
Un team di ricerca ha sviluppato QFoldAgent, un sistema multi-agente autonomo che combina intelligenza artificiale e computazione quantistica per prevedere la struttura delle proteine. Il framework supera i limiti dei metodi tradizionali automatizzando la calibrazione dei parametri critici. I risultati mostrano miglioramenti significativi sia sulla precisione strutturale che sulla validità delle previsioni.
Ricerca
arXiv cs.AI
28 lug, 19:06
LLM inaffidabili: la stessa domanda, risposte diverse
Uno studio su 13 modelli e 4 benchmark dimostra che i grandi modelli linguistici cambiano risposta quando la stessa domanda viene riformulata in modo equivalente. Il tasso di incongruenza supera il 23% in molti casi. L'accuratezza sui benchmark, da sola, non basta a misurare l'affidabilità reale.
Ricerca
arXiv cs.AI
28 lug, 19:06
AI medica: un modello piccolo batte i giganti con workflow
Un team di ricerca ha dimostrato che un modello linguistico da 7 miliardi di parametri, se guidato da un processo strutturato in cinque fasi, supera Claude e Gemini nella diagnosi medica. Il guadagno in accuratezza rispetto all'uso diretto del modello è di 36 punti percentuali, ottenuto solo dalla progettazione del flusso di lavoro. Il costo per caso è inferiore di oltre il 35% rispetto ai modelli frontier.