Ultime notizie — pagina 3
Ricerca
arXiv cs.AI
16 lug, 16:36
LLM: ragionano davvero o fingono di farlo?
Un nuovo metodo chiamato 'interventional grounding audits' permette di verificare se i modelli di linguaggio come GPT-4o ragionano davvero in base alle premesse fornite o producono risposte corrette per le ragioni sbagliate. La tecnica, testata su GPT-4o, ha raggiunto un F1 di 0.806 nel rilevare dipendenze logiche reali. Il 66% dei problemi risolti correttamente nascondeva almeno un passaggio di ragionamento non genuinamente ancorato alle premesse.
Ricerca
arXiv cs.AI
16 lug, 16:36
SPINE: l'AI agente che installa i robot al posto tuo
Un team di ricerca ha sviluppato SPINE, un framework basato su agenti AI capace di configurare e mettere in funzione robot bimanuali senza richiedere competenze specialistiche in robotica. Il sistema supera in efficacia persino operatori esperti, portando il tasso di successo al 100%. È un passo concreto verso la democratizzazione dell'Embodied AI.
Ricerca
arXiv cs.AI
15 lug, 10:07
IA che impara dal contesto senza aggiornarsi: la sfida del mondo reale
Un nuovo studio sistematizza il campo dell'in-context reinforcement learning in ambienti non stazionari, dove le regole del gioco cambiano durante il deployment. La sfida è costruire agenti capaci di adattarsi usando solo ciò che vedono nel contesto, senza modificare i propri parametri. Un problema cruciale per chi vuole portare l'IA in produzione.
Ricerca
arXiv cs.AI
15 lug, 10:07
Market making su futures perpetui: arriva la formula matematica
Un team di ricercatori ha sviluppato un framework teorico rigoroso per ottimizzare le strategie di market making sui mercati di futures perpetui decentralizzati. Il modello affronta la complessità di gestire spread, inventario e hedging simultaneamente, introducendo una formula universale per stimare l'APY raggiungibile. Il lavoro unifica e aggiorna i principali paradigmi classici della microstruttura dei mercati finanziari.
Ricerca
arXiv cs.AI
15 lug, 10:07
AI sovrana per le banche: distillazione ontologica e audit
Un nuovo studio combina due tecniche per portare modelli linguistici avanzati dentro il perimetro delle istituzioni finanziarie regolamentate. I risultati sono promettenti ma onesti: nessuna superiorità dimostrata, ma un percorso metodologico concreto. Il valore sta nel framework, non nelle performance.
Ricerca
arXiv cs.AI
15 lug, 10:06
RL per serre intelligenti: arriva l'audit dei reward
Un nuovo framework propone un metodo riproducibile per analizzare e confrontare le singole componenti della funzione di reward nei sistemi di controllo climatico basati su reinforcement learning. L'approccio è pensato per serre intelligenti e si integra con simulatori e dati reali. L'obiettivo è rendere le decisioni automatizzate più trasparenti e verificabili.
Tool
arXiv cs.AI
15 lug, 10:06
GRID: SQL sicuro e certificato per le aziende con l'AI
Un team di ricercatori ha sviluppato GRID, un motore di decodifica vincolata a grammatica che garantisce la generazione di SQL valido, conforme alle policy aziendali e verificabile. Il sistema risolve uno dei problemi più concreti nell'adozione enterprise dei modelli linguistici: la mancanza di garanzie formali sull'output.
Tool
Google AI Blog
15 lug, 10:06
Google Immagini compie 25 anni: evoluzione e novità
Google Immagini festeggia un quarto di secolo di ricerca visuale, ripercorrendo i traguardi più significativi raggiunti dalla piattaforma. L'anniversario è anche l'occasione per presentare nuove funzionalità legate all'esplorazione e alla creazione di contenuti visivi. Un momento che invita a riflettere su quanto la ricerca per immagini abbia trasformato il modo in cui accediamo alle informazioni.