Language and Vision - LaVi Group
Il linguaggio e la visione costituiscono due modalità fondamentali attraverso cui la specie umana acquisisce la conoscenza del mondo. La facoltà di osservare e verbalizzare oggetti ed eventi circostanti permette l'apprendimento delle proprietà e delle relazioni inerenti agli oggetti stessi. Tali modalità presentano un elevato grado di interdipendenza, determinando una costante integrazione delle informazioni acquisite attraverso di esse. Ciononostante, i modelli computazionali del linguaggio e della visione si sono sviluppati lungo direttrici autonome, conducendo le rispettive comunità di ricerca a una prolungata e reciproca indipendenza metodologica. Cionondimeno, tali linee di ricerca parallele sono giunte a formalizzare rappresentazioni altamente compatibili, rispettivamente per le unità lessicali e per le immagini.
L'importanza di strutturare modelli computazionali integrati di linguaggio e visione è stata postulata da filosofi e scienziati cognitivi fin dalle origini dell'intelligenza artificiale. Tuttavia, solo in tempi recenti tale prospettiva è stata affrontata sul piano empirico da linguisti computazionali e ricercatori nel campo della computer vision.
Negli ultimi due decenni, la disponibilità di imponenti moli di dati testuali sul web ha fornito un forte impulso alla ricerca nell'ambito del Natural Language Processing (NLP). Motori di ricerca testuali complessi sono ormai consolidati e integrati nella prassi quotidiana. L'analisi del dato visivo rappresenta la naturale evoluzione nella società digitale: la convergenza tra linguaggio e visione costituisce il paradigma trainante di questa nuova fase scientifica.
Linee di ricerca
- Modellazione dell'acquisizione di competenze cognitive primarie: i modelli multimodali sono in grado di acquisire abilità cognitive fondamentali, quale il senso del numero (numerosity)? Tali abilità costituiscono competenze chiave anche per le architetture computazionali, favorendo l'apprendimento di ulteriori funzioni?
- Apprendimento della percezione visiva mediante interazione: nell'infanzia, l'apprendimento avviene attraverso l'interazione con l'ambiente e con gli altri individui. È possibile addestrare un modello ad ancorare (grounding) il linguaggio alla dimensione visiva attraverso processi interattivi?
Per l'elenco completo delle pubblicazioni, consultare la pagina personale di Raffaella Bernardi.
- Raffaella Bernardi - Responsabile Scientifico (Principal Investigator)
- Davide Mazzaccara - Dottorando
- Olga Loginova - Dottoranda
- Leonardo Bertolazzi - Dottorando
Ex membri del gruppo:
- Elia Bruni
- Eleonora Gualdoni
- Angeliki Lazaridou
- D. Tien Nguyen
- Sandro Pezzelle
- Ravi Shenkar
- David Addison Smith
- Ionut-Teodor Sorodoc
- Dieu Thu Le
- Claudio Greco
- Alberto Testoni
- Stella Frank
- Luciana Benotti (Universidad Nacional de Córdoba, Argentina)
- Gemma Boleda (Departament de Traducció i Ciències del Llenguatge, Universitat Pompeu Fabra, Spagna)
- Raquel Fernández (Institute for Logic, Language and Computation - ILLC, University of Amsterdam, Paesi Bassi)
- Albert Gatt (Institute of Linguistics and Language Technology, University of Malta, Malta)
- Moin Nabi (SAP)
- Barbara Plank (IT University of Copenhagen, Danimarca)
Il gruppo ha partecipato alla COST Action intitolata The European Network on Integrating Vision and Language, ha preso parte al seminario Dagstuhl su Joint Processing of Language and Visual Data for Better Automated Understanding ed è stato organizzatore di molteplici workshop internazionali dedicati a queste tematiche di ricerca.