Université Côte d'azur

ECUE Econométrie Panel 2

Code de l'ECUE : IMEEEP3

Ce cours est proposé dans 2 UE
EUR ELMI
Sciences économiques
Campus Saint Jean d'Angély
Master 2
Semestre impair
Français

PRESENTATION

Chapitre 2 : machine learning appliqué Ce chapitre porte sur l'apprentissage supervisé, avec un objectif : construire des modèles prédictifs. Il ne s'agit ni d'identifier des effets causaux ni d'interpréter les paramètres estimés. Le but est de produire des prédictions fiables sur des données nouvelles, que le modèle n'a jamais vues pendant l'entraînement. Un modèle se juge donc à sa qualité prédictive mesurée hors échantillon, et non à sa capacité à expliquer pourquoi un phénomène se produit. Ce changement de perspective justifie l'usage d'algorithmes flexibles, parfois qualifiés de « boîtes noires ».

Le cours présente d'abord les notions qui en découlent : compromis biais-variance, sur-ajustement et sous-ajustement, métriques de performance pour la régression et la classification. Il montre ensuite comment évaluer un modèle : réglage des hyperparamètres, découpage des données, validation croisée, etc.

Le cours est appliqué et entièrement mis en œuvre en Python. Les étudiants y utilisent les principales bibliothèques de la data science : NumPy, pour le calcul numérique ; pandas, pour manipuler et explorer les données tabulaires ; scikit-learn, pour le prétraitement, la construction des modèles, la recherche d'hyperparamètres et l'évaluation ; joblib et dill, pour sauvegarder les modèles.

Responsable(s) du cours

Présentiel

  • 20h de cours magistral

Distanciel

  • 20h de cours magistral

PREREQUIS

Avant le début du cours, je dois ...
  • Avoir suivi un cours d'introduction en économétrie
  • Notions de statistiques inférentielles
  • Notions en python

OBJECTIFS

A la fin de ce cours, je devrais être capable de...
  • distinguer un objectif de prédiction d'un objectif d'inférence causale
  • formuler un problème concret comme un problème d'apprentissage supervisé (cible, features, régression ou classification)
  • expliquer le compromis biais-variance et diagnostiquer un sur-ajustement ou un sous-ajustement
  • choisir et interpréter une métrique de performance prédictive adaptée au problème (MSE, R², accuracy, précision, F1-score, etc.)
  • mesurer la capacité de généralisation d'un modèle par une stratégie de validation rigoureuse (train/validation/test, validation croisée K-fold)
  • comparer plusieurs modèles selon leur performance prédictive et sa stabilité, puis retenir le meilleur
  • manipuler, explorer et nettoyer des données avec pandas et NumPy
  • construire avec scikit-learn une pipeline complète, du prétraitement (imputation, encodage, normalisation, transformations personnalisées)
  • régler les hyperparamètres avec GridSearchCV et RandomizedSearchCV
  • sauvegarder un modèle entraîné avec joblib ou dill et le transmettre pour qu'il soit évalué sur des données nouvelles

CONTENU

Accéder au Syllabus complet (Authentification requise)
Important
Ce syllabus n’a aucune valeur contractuelle. Son contenu est susceptible d’évoluer en cours d’année : soyez attentifs aux dernières modifications.