Chapitre 2 : machine learning appliqué Ce chapitre porte sur l'apprentissage supervisé, avec un objectif : construire des modèles prédictifs. Il ne s'agit ni d'identifier des effets causaux ni d'interpréter les paramètres estimés. Le but est de produire des prédictions fiables sur des données nouvelles, que le modèle n'a jamais vues pendant l'entraînement. Un modèle se juge donc à sa qualité prédictive mesurée hors échantillon, et non à sa capacité à expliquer pourquoi un phénomène se produit. Ce changement de perspective justifie l'usage d'algorithmes flexibles, parfois qualifiés de « boîtes noires ».
Le cours présente d'abord les notions qui en découlent : compromis biais-variance, sur-ajustement et sous-ajustement, métriques de performance pour la régression et la classification. Il montre ensuite comment évaluer un modèle : réglage des hyperparamètres, découpage des données, validation croisée, etc.
Le cours est appliqué et entièrement mis en œuvre en Python. Les étudiants y utilisent les principales bibliothèques de la data science : NumPy, pour le calcul numérique ; pandas, pour manipuler et explorer les données tabulaires ; scikit-learn, pour le prétraitement, la construction des modèles, la recherche d'hyperparamètres et l'évaluation ; joblib et dill, pour sauvegarder les modèles.