University Côte d'azur

ECUE Econométrie Panel 2

ECUE's code : IMEEEP3

Belong to 2 UE
EUR ELMI
Sciences économiques
Campus Saint Jean d'Angély
Master 2
Semestre impair
Français

PRESENTATION

Chapitre 2 : machine learning appliqué Ce chapitre porte sur l'apprentissage supervisé, avec un objectif : construire des modèles prédictifs. Il ne s'agit ni d'identifier des effets causaux ni d'interpréter les paramètres estimés. Le but est de produire des prédictions fiables sur des données nouvelles, que le modèle n'a jamais vues pendant l'entraînement. Un modèle se juge donc à sa qualité prédictive mesurée hors échantillon, et non à sa capacité à expliquer pourquoi un phénomène se produit. Ce changement de perspective justifie l'usage d'algorithmes flexibles, parfois qualifiés de « boîtes noires ».

Le cours présente d'abord les notions qui en découlent : compromis biais-variance, sur-ajustement et sous-ajustement, métriques de performance pour la régression et la classification. Il montre ensuite comment évaluer un modèle : réglage des hyperparamètres, découpage des données, validation croisée, etc.

Le cours est appliqué et entièrement mis en œuvre en Python. Les étudiants y utilisent les principales bibliothèques de la data science : NumPy, pour le calcul numérique ; pandas, pour manipuler et explorer les données tabulaires ; scikit-learn, pour le prétraitement, la construction des modèles, la recherche d'hyperparamètres et l'évaluation ; joblib et dill, pour sauvegarder les modèles.

Course's manager(s)

In class

  • 20h of lectures

Distant

  • 20h of lectures

PREREQUISITES

Before the start of the course, I must ...
  • Avoir suivi un cours d'introduction en économétrie
  • Notions de statistiques inférentielles
  • Notions en python

OBJECTIVES

By the end of this course, I should be able to...
  • distinguer un objectif de prédiction d'un objectif d'inférence causale
  • formuler un problème concret comme un problème d'apprentissage supervisé (cible, features, régression ou classification)
  • expliquer le compromis biais-variance et diagnostiquer un sur-ajustement ou un sous-ajustement
  • choisir et interpréter une métrique de performance prédictive adaptée au problème (MSE, R², accuracy, précision, F1-score, etc.)
  • mesurer la capacité de généralisation d'un modèle par une stratégie de validation rigoureuse (train/validation/test, validation croisée K-fold)
  • comparer plusieurs modèles selon leur performance prédictive et sa stabilité, puis retenir le meilleur
  • manipuler, explorer et nettoyer des données avec pandas et NumPy
  • construire avec scikit-learn une pipeline complète, du prétraitement (imputation, encodage, normalisation, transformations personnalisées)
  • régler les hyperparamètres avec GridSearchCV et RandomizedSearchCV
  • sauvegarder un modèle entraîné avec joblib ou dill et le transmettre pour qu'il soit évalué sur des données nouvelles

CONTENT

Access to complete Syllabus (Authentification required)
Important
This syllabus has no contractual value. Its content is subject to change throughout this year: be aware to the last updates