2.12.19 (788)

Cours scientifiques - CSC_53449_EP : 3D Computer Vision

Domaine > Informatique.

Descriptif

Ce cours explore les approches modernes d'apprentissage et d'inférence en vision par ordinateur et en compréhension de scènes 3D. Les étudiants étudieront quatre paradigmes complémentaires qui structurent le domaine aujourd'hui : les représentations neuronales implicites (INR) pour encoder des signaux et de la géométrie sous forme continue ; l'analyse par synthèse via le rendu différentiable, illustrée par les champs de radiance neuronaux (NeRF) ; l'inférence amortie pour la reconstruction 3D rapide, avec des modèles feed-forward récents tels que DUSt3R et VGGT ; et les modèles génératifs vidéo, ainsi que les modèles vision-langage-action (VLA) pour la prise de décision en environnements dynamiques.

Le cours combine fondements théoriques et expérimentation pratique. L'enseignement s'articule autour de quatre cours magistraux (3 heures chacun) introduisant les concepts clés et la littérature récente, de deux séances de travaux pratiques (3 heures chacune) au cours desquelles les étudiants implémentent et analysent les méthodes étudiées, et d'un projet final (deux séances de 3 heures) où de petits groupes explorent un sujet de leur choix, en s'appuyant sur les techniques vues en cours. Le projet se conclut par une présentation orale et un court rapport écrit.

À l'issue du cours, les étudiants seront familiarisés avec les approches de pointe en représentation neuronale de scènes et en perception générative, et auront acquis une expérience pratique de l'implémentation, l'entraînement et l'évaluation de tels modèles.

Objectifs pédagogiques

À l'issue de ce cours, les étudiants seront capables de :

  • Expliquer les principes des représentations neuronales implicites et analyser comment des paramétrisations continues permettent d'encoder signaux, géométrie et apparence.
  • Décrire le paradigme d'analyse par synthèse et dériver comment le rendu différentiable permet la reconstruction 3D à partir d'images posées, comme illustré par NeRF.
  • Comparer les approches d'optimisation et d'inférence amortie (feed-forward) pour la reconstruction 3D, et justifier leurs compromis respectifs en termes de précision, de vitesse et de généralisation.
  • Implémenter et entraîner les modèles centraux abordés en cours (par exemple un INR, un petit NeRF ou un module de reconstruction feed-forward) à l'aide de frameworks modernes d'apprentissage profond.
  • Concevoir et mener un petit projet à caractère recherche appliquant ou étendant l'une des méthodes étudiées, et communiquer les résultats à travers une présentation orale et un rapport écrit.

Diplôme(s) concerné(s)

Format des notes

Numérique sur 20

Littérale/grade américain

Pour les étudiants du diplôme MScT-Visual Computing and Creative AI

Pour les étudiants du diplôme MScT-Artificial Intelligence and Advanced Visual Computing

Le rattrapage est autorisé (Max entre les deux notes)
  • le rattrapage est obligatoire si :
    Note initiale < 10
  • le rattrapage peut être demandé par l'étudiant si :
    Note initiale < 10
L'UE est acquise si Note finale >= 10
  • Crédits ECTS acquis : 2 ECTS

La note obtenue rentre dans le calcul de votre GPA.

Programme détaillé

More details can be found on the class website.

Mots clés

Computer Vision with Deep Learning
Veuillez patienter