Les tests classiques comme GLRT
En analyse de données expérimentales, les tests portent des noms : test t, test du scipy correspondante.
1. Lien avec le cours
Le projet applique le GLRT et le réglage de seuil à
2. Structure du code
Le cadre commun des projets s'applique : les modèles qui simulent les données sous chaque hypothèse, une fonction par statistique de test, et une fonction de calibration générique, réutilisable pour tout test dont la loi sous
def t_statistic(x, mu0):
"""One-sample t statistic."""
...
def chi2_statistic(counts, expected):
"""Pearson goodness-of-fit statistic."""
...
def f_statistic(groups):
"""One-way ANOVA F statistic, from the two least squares residuals."""
...
def calibrate_threshold(statistic, sample_h0, alpha, m, rng):
"""Empirical (1 - alpha) quantile of the statistic over m draws under H0."""
...Tests imposés. Le méta-test de tout ce projet : pour chacun des trois tests, la fréquence de rejet sous sta.ttest_1samp, sta.chisquare et sta.f_oneway.
3. Travail demandé
- Le test t, dérivation guidée. Reprendre le GLRT du décalage de moyenne lorsque
est inconnue : montrer que maximiser la vraisemblance sous chaque hypothèse conduit à une statistique équivalente à , où est l'écart-type estimé. Vérifier par Monte-Carlo que, sous , l'histogramme de suit la loi de Student ( sta.t) et non la Gaussienne : superposer les trois courbes pour, et commenter les queues. - Application du test t. Une machine remplit des bouteilles (
mesures, consigne ml) : simuler une machine déréglée de ml, tester au niveau , rapporter statistique, seuil et p-value, et confronter à sta.ttest_1samp. - Le test du χ². Implémenter la statistique de Pearson
et vérifier par Monte-Carlo que, sous , elle suit . L'appliquer à un dé pipé, face 6 à au lieu de : tester à puis à lancers. Le résultat à lancers doit vous surprendre ; l'expliquer avec le vocabulaire du cours, la puissance du test à cet effectif, et en tirer la règle : ne pas rejeter ne prouve jamais . - L'ANOVA, dérivation guidée. Pour
groupes de mesures Gaussiennes de variance commune inconnue, poser les deux modèles emboîtés, une moyenne par groupe contre une moyenne commune, et montrer que le GLRT revient à seuiller , le rapport des résidus des deux ajustements par moindres carrés (indication : le MLE de la variance vaut , et ). Vérifier la loi par Monte-Carlo, puis appliquer à trois machines ( chacune, moyennes vraies , , ml) et confronter à sta.f_oneway. - Quand la loi n'est pas en table. Reprendre le test t avec un bruit non Gaussien (exponentiel centré) : la loi de Student n'est plus exacte. Calibrer le seuil avec
calibrate_threshold, vérifier laobtenue, et comparer aux seuils de Student : la calibration par simulation est la méthode qui marche toujours, c'est celle du décodeur DTMF. - Étude de puissance. Pour le test t et le dé pipé, tracer
en fonction de l'effectif ( de à , Monte-Carlo). À partir de quel effectif chaque écart est-il détecté neuf fois sur dix au niveau ?
4. Livrables
Le notebook reproductible des modalités communes, avec les deux dérivations guidées rédigées, les histogrammes de vérification des trois lois sous
