Multimodal learning illustration banner

LAVI: Lab for Artificial Visual Intelligence

Sviluppare l’intelligenza visiva mediante l’apprendimento multimodale, modelli efficienti e sistemi affidabili.

Benvenuti alla pagina ufficiale del Lab for Artificial Visual Intelligence (LAVI), pronunciato la vie in francese. Presso LAVI sviluppiamo metodi di Intelligenza Artificiale (IA), con particolare attenzione alla computer vision e all’IA generativa, per affrontare problemi complessi di percezione. La nostra ricerca integra visione, linguaggio e dati strutturati per progettare modelli robusti ed efficienti dal punto di vista dei dati, destinati alla percezione automatica e capaci di operare in contesti complessi e sfidanti.

Siamo particolarmente interessati a approcci di apprendimento a basso consumo di risorse e affidabili, con applicazioni in robotica, telerilevamento e imaging medico, dove accuratezza e adattabilità sono entrambi aspetti fondamentali.

LAVI è diretto dal Dr. Subhankar Roy, Ricercatore a tempo determinato (Tenure-Track Assistant Professor) presso il Dipartimento di Ingegneria Gestionale, dell’Informazione e della Produzione (DIGIP) dell’ Università di Bergamo, Italia.

Prospective Visiting PhD students

Accogliamo con interesse dottorandi motivati che desiderino svolgere un periodo di visita presso il nostro laboratorio, collaborando su tematiche di apprendimento multimodale, intelligenza artificiale efficiente e sistemi affidabili per la visione e il linguaggio. Se interessati, si prega di consultare la pagina dei contatti per ulteriori informazioni.

Pagina dei contatti

Temi di Ricerca

L’apprendimento multimodale

Apprendimento congiunto da visione, linguaggio e dati strutturati

Apprendimento con risorse limitate

Progettazione di modelli in grado di operare con dati, capacità di calcolo e memoria limitati

IA affidabile

Sistemi di machine learning robusti, estendibili, preservanti la privacy e affidabili

Ambiti di applicazione

Computer Vision

Compiti classici della visione artificiale: riconoscimento delle immagini, rilevamento degli oggetti, segmentazione semantica e generazione di immagini

Robotica

Modelli che consentono ai robot di percepire, ragionare e agire in ambienti reali

Remote Sensing

Apprendimento multimodale per il telerilevamento finalizzato al monitoraggio e all’analisi ambientale robusti

Imaging medicale

Applicazione dell’apprendimento multimodale all’imaging medicale per una diagnosi robusta e il supporto alle decisioni cliniche

Notizie

  • [Jun, 2026] La nostra paper "ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models" accettata a ECCV 2026!
  • [Mar, 2026] La nostra paper "Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs" accettata a IJCNN 2026!
  • [Feb, 2026] La nostra paper "Organizing Unstructured Image Collections using Natural Language" accettata a CVPR Findings 2026!
  • [Jan, 2026] La nostra paper "Ensembling Pruned Attention Heads For Uncertainty-Aware Efficient Transformers" accettata a ICLR 2026!
  • [2025] 📣 Siamo entusiasti di annunciare il lancio del Lab for Artificial Visual Intelligence (LAVI)!