Motion, Vision and Language Lab - MoViLa
L'imponente mole di dati multimodali oggi disponibile – che abbraccia linguaggio naturale, segnali visivi, cinematici e sensoriali – ha reso possibile l'affermazione di potenti modelli di Intelligenza Artificiale in grado di mostrare notevoli capacità percettive e di ragionamento. Ciononostante, tali sistemi rimangono vincolati da un elevato costo computazionale, dall'assunzione di scenario chiuso (closed-world assumption) e da una limitata capacità di adattamento al di fuori di contesti di valutazione (benchmark) rigidamente strutturati.
Ispirandosi alla capacità del cervello umano di integrare in modo efficiente percezione e linguaggio, il nostro gruppo di ricerca indaga le modalità con cui i sistemi artificiali possano acquisire conoscenza attraverso differenti modalità sensoriali secondo paradigmi scalabili e adattivi. Esploriamo modelli multimodali di ampie dimensioni (large multimodal models) applicati a compiti quali la classificazione di immagini in contesti aperti (open-world image classification), il riconoscimento di azioni in modalità zero-shot e la localizzazione temporale delle azioni, sviluppando al contempo metodologie per la distillazione avversaria della conoscenza (adversarial knowledge distillation), la generazione efficiente basata su modelli di diffusione, la comprensione del movimento tridimensionale (3D) e il benchmarking automatizzato di modelli multimodali.
La nostra attività di ricerca coniuga la visione artificiale (computer vision), l'analisi del movimento e la linguistica computazionale, riflettendo la missione del dipartimento volta allo studio dell'intelligenza all'intersezione tra neuroscienze e linguaggio. L'obiettivo finale è la progettazione di modelli capaci di apprendere in modo continuo e flessibile attraverso molteplici modalità, rispecchiando la robustezza della cognizione e della comunicazione umana e contribuendo a una comprensione più profonda dell'intelligenza, sia artificiale sia biologica.
Linee di ricerca
Le principali tematiche di interesse includono:
- Visione e Linguaggio (Vision and Language)
- Comprensione del Video (Video Understanding)
- Comprensione del Movimento 3D (3D Motion Understanding)
- Riconoscimento a Vocabolario Aperto (Open-vocabulary Recognition)
Per l'elenco completo delle pubblicazioni, consultare il profilo Google Scholar di Paolo Rota.
- Paolo Rota, Responsabile Scientifico (Principal Investigator)
- Benedetta Liberatori, Dottoranda (in co-tutela con la professoressa Elisa Ricci)
- Shiyao Xu, Dottorando
- Yan Shu, Dottorando (in co-tutela con il professore Niculae Sebe)
- Jiaqi Liu, Dottorando (in co-tutela con il professore Niculae Sebe)
- Ester Riccardi, Dottoranda (in co-tutela con il professore Roberto Bottini)