Syllabus
La modélisation introduit souvent de l'alea, parfois pour tenir compte de notre ignorance, parfois pour des raisons plus profondes (incertitude dans les observations, dans les comportements humains, dans les paramètres qui régissent les systèmes, etc). L'objectif de la statistique est d'analyser rigoureusement ces incertitudes : estimer ce qui est inconnu, quantifier les erreurs, tester des hypothèses. C'est un prérequis à l'apprentissage automatique.
Le programme couvre les bases théoriques de la statistique dans le régime classique où le nombre d'observations est grand et la dimension des modèles est petite : tests, intervalles de confiance, estimateurs, modèles linéaires, modèles exponentiels, estimation de densité. Je porterai une attention particulière aux liens qui existent entre la statistique moderne, la physique statistique, et la théorie de l'information, qui ne sont rien d'autre que trois points de vue différents sur la notion d'information.
À la fin de ce cours, les étudiants sauront
- comment définir correctement un modèle stochastique en fonction du problème traité (modèles gaussiens, modèles discrets, modèles linéaires, etc.) ;
- mettre en place des stratégies pour estimer des paramètres inconnus ("estimer un rendement moyen à partir de rendements passés") dans toute une variété de problèmes, asymptotique ou non, gaussien ou non, etc. ;
- quantifier l'incertitude liés à ces estimations à l'aide de régions de confiance ;
- répondre de façon rigoureuse à des questions binaires (peut-on vraiment dire que moins de la moitié de la population possède un tel ou tel trait génétique ? ce dé est-il pipé ? ces comportements sont-ils indépendants ? etc) en utilisant les tests adéquats ;
- identifier quand une stratégie est la meilleure possible (Lemme de Neyman-Pearson, principe du maximum de vraisemblance) ;
- définir, manipuler et analyser les modèles linéaires (loi exacte, loi asymptotique), mettre en place des tests de significativité, construire des intervalles de prédiction ;
- estimer des densités de probabilités avec des méthodes élémentaires (noyaux) ou tester l'adéquation avec une loi donnée (Kolmogorov-Smirnov);
- interpréter les méthodes statistiques comme des problèmes convexes de minimisation d'information ;
- écrire des modèles statistique sous leur forme exponentielle, manipuler leur fonction de partition, et relier entre elles les notions de score, d'information et d'entropie.
Sommaire
Inférence statistique.
- Modèles statistiques
- Notion d'estimateur et convergences
- Méthode des moments
Régions de confiance
- Principe général
- Exemples de constructions
- Inégalités de concentration élémentaires
Tests du chi-deux
- Tests d'adéquation à une loi discrète
- Tests d'indépendance
Modèles linéaires
- Moindres carrés généraux
- Modèle linéaire gaussien ou non
- Tests sur les paramètres d'une régression linéaire
- Modèles linéaires généralisés
Modèles exponentiels
- Définitions, fonction de partition, calculs
- Maximum de vraisemblance
- Information de Fisher
- Optimalité de Cramér-Rao
Estimation de densité
- Histogrammes
- Méthodes à noyaux
- Lemme de Glivenko-Cantelli
- Théorème de Kolmogorov-Smirnov
Bibliographie
Bickel, P. J., & Doksum, K. A. (2015-2017). Mathematical statistics: basic ideas and selected topics. volumes I & II. CRC Press.