Estimateurs usuels
La page précédente a donné les critères pour juger un estimateur, mais aucun moyen d'en construire un. Cette page comble ce manque : la section 1 pose le cadre commun, minimiser une fonction de coût, les sections 2 à 4 l'instancient en trois estimateurs, le maximum de vraisemblance, les moindres carrés et le maximum a posteriori, la section 5 apprend l'estimateur sur des exemples, la section 6 fournit les algorithmes qui minimisent une loss lorsque aucune formule explicite n'existe, et la section 7 récapitule les quatre estimateurs et leurs hypothèses.
1. Problématique
Les trois estimateurs de la borne supérieure de la page précédente,
Comment déterminer la fonction
La réponse suivie dans toute cette page consiste à ramener la construction d'un estimateur à un problème de minimisation. Nous nous donnons une fonction de coût
où
est la loss, une fonction du paramètre à données fixées, est l'ensemble des valeurs admissibles du paramètre.
Choisir un estimateur revient alors à choisir une loss. Les sections 2 à 5 en proposent quatre, issues de raisonnements différents ; la section 6 traite le problème d'optimisation lui-même, commun à tous les estimateurs de la page.
2. Maximum de vraisemblance
Une pièce est lancée
Hypothèses
Le maximum de vraisemblance suppose une hypothèse forte : la loi des données est connue, à la valeur de ses paramètres près
Nous disposons donc de
Expression
Définition, Maximum de vraisemblance (MLE)
La loss du maximum de vraisemblance (maximum likelihood estimator) est la log-vraisemblance négative des données observées :
où
et
est la vraisemblance, la loi des données évaluée en l'observation reçue, est la log-vraisemblance.
Notons que l'application du logarithme ne déplace pas l'optimum, puisqu'il est strictement croissant, mais il transforme le produit des densités i.i.d. en somme, ce qui rend la dérivation praticable et évite les dépassements numériques. Une vraisemblance de
Confusion classique
« La vraisemblance est la probabilité que
Propriétés
Le MLE ne garantit rien à
Propriétés asymptotiques du MLE
Sous conditions de régularité, quand
- convergent :
tend vers la vraie valeur en probabilité ; - asymptotiquement sans biais :
; - asymptotiquement efficace : sa variance atteint la borne de Cramér-Rao, aucun estimateur sans biais ne fait mieux ;
- asymptotiquement Gaussien : sa loi tend vers
.
Ces propriétés sont admises. Elles sont asymptotiques : rien n'interdit au MLE d'être biaisé pour un
La normalité asymptotique a une retombée pratique immédiate : elle fournit un intervalle de confiance autour de l'estimation.
Proposition, Intervalle de confiance asymptotique
Pour
contient la vraie valeur
Confusion classique
« Il y a 95 % de chances que
Pour la pièce de l'exemple qui suit (
Exemple : paramètre d'une loi de Bernoulli
Soit
L'annulation de cette dérivée donne l'estimateur, qui n'est autre que la fréquence observée :
Figure 2.3a, Vraisemblance figures/ch2/02-vraisemblance-bernoulli.py).
Figure 2.3b, Loss
Les deux courbes désignent le même point,
3. Moindres carrés
Hypothèses
L'estimateur des moindres carrés présuppose un modèle de signal particulier. Spécifiquement, il considère que les échantillons reçus se décomposent en un signal dépendant d'un paramètre
où
Expression
Pour estimer
Définition, Moindres carrés (LSE)
La loss des moindres carrés (least squares estimator) est l'écart quadratique entre les données et le signal du modèle :
où
Aucune hypothèse probabiliste n'intervient dans cette loss : le critère est purement géométrique, et il se pose même là où la notion de bruit aléatoire n'a aucun sens.
Propriétés
Proposition, Lien avec le MLE
Lorsque
Démonstration
Les
où la somme est exactement
Cette propriété montre que l'ajustement par erreur quadratique, posé sans aucune hypothèse probabiliste, est précisément ce que produit le maximum de vraisemblance dès que le bruit est Gaussien blanc. Le paramètre
🎯 Le choix de la loss est un choix de modèle de bruit
Le même calcul mené avec un bruit laplacien,
Quand un cours d'apprentissage automatique propose un catalogue de loss, il propose en réalité un catalogue d'hypothèses sur le bruit.
Lorsque
4. Maximum a posteriori
Le MLE traite
Hypothèses
Deux hypothèses définissent le cadre :
- le paramètre est modélisé comme une variable aléatoire, munie d'une loi
connue, le prior
- la loi des données à paramètre fixé,
, est connue :
⚠ Changement de statut de
Jusqu'ici
Expression
La valeur retenue est la plus probable au vu des données, celle qui maximise la loi a posteriori
Définition, Maximum a posteriori (MAP)
La loss du maximum a posteriori ajoute un terme de prior à la loss des données :
où
et
est la loss du MLE, l'attache aux données, pénalise les valeurs du paramètre peu plausibles a priori.
Propriétés
Proposition, Lien avec le MLE
Lorsque le prior suit une loi uniforme sur
Exemple : moyenne d'une Gaussienne avec prior
Soit
L'annulation de la dérivée donne
Le facteur devant
5. Estimateur appris (data-driven)
Les trois estimateurs précédents dérivent
Hypothèses
Deux hypothèses définissent le cadre.
- Un modèle d'estimateur. La forme de l'estimateur est postulée :
où
- Une base de données. Une base d'apprentissage de
exemples est disponible, le paramètre étant connu pour chacun. Chaque exemple est construit par deux tirages successifs :
où
Expression
Définition, Estimateur appris
L'estimateur est la fonction ajustée,
où les paramètres
avec
Trois différences avec les sections précédentes. Spécifiquement,
- la minimisation porte sur
, les paramètres de l'estimateur, et non sur directement ; - la loss se mesure dans l'espace du paramètre, entre la valeur vraie
et son estimation, alors que celle du LSE se mesure dans l'espace des observations, entre les échantillons reçus et le signal que le modèle prédit ; - la MSE des sections précédentes se calculait à
fixé ; ici est tiré selon , et est donc la MSE moyennée sur les exemples tirés selon .
Implémentation
L'estimateur s'obtient en deux phases, et c'est là sa particularité :
- apprentissage, effectué une seule fois : constituer la base, puis minimiser
avec les algorithmes de la section 6 ; - exploitation, répétée à chaque nouvelle observation : évaluer
.
Le MLE, le LSE et le MAP relancent une optimisation pour chaque observation reçue. Ici l'optimisation est payée une fois, et chaque estimation ultérieure ne coûte qu'une évaluation de fonction.
DANGER
Pour évaluer les performances d'un estimateur appris, il est nécessaire d'utiliser une base de test différente de la base d'apprentissage.
Exemple : borne supérieure d'une loi uniforme
Reprenons l'estimation de
L'apprentissage porte sur
import numpy as np
from sklearn.neural_network import MLPRegressor
rng = np.random.default_rng(2026)
N, M = 8, 60_000
# one theta per example, then N sorted measurements drawn for that theta
theta_train = rng.uniform(1.0, 10.0, M)
x_train = np.sort(rng.uniform(0, 1, size=(M, N)) * theta_train[:, None], axis=1)
net = MLPRegressor(hidden_layer_sizes=(64,) * 4, activation="relu",
max_iter=600, early_stopping=True, random_state=0)
net.fit(x_train, theta_train)La performance se mesure sur des tirages neufs, à
Figure 2.4, MSE des trois estimateurs en fonction de figures/ch2/02-reseau-borne-sup.py).
Dans le domaine d'apprentissage, le réseau bat nettement le maximum, d'un facteur voisin de deux, et dépasse même le maximum recalibré au-delà de
Au-delà de
Ce contraste vient du décalage entre les deux points de vue. L'apprentissage a minimisé la MSE moyennée sur
6. Optimisation numérique de la loss
Problématique
Les estimateurs des sections précédentes s'obtiennent en minimisant une loss en fonction du paramètre
Pour illustrer ce problème, nous allons considérer une sinusoïde de pulsation inconnue, observée dans du bruit,
Figure 2.5a, Loss figures/ch2/02-mle-sinusoide-loss.py).
La loss des moindres carrés est présentée dans la figure 2.5a. Cette loss n'est pas linéaire en
- la loss est fortement multimodale : elle oscille autour de
sur tout l'intervalle, avec des dizaines de minima locaux dus à la périodicité du cosinus, - le minimum global est étroit et profond, il descend à
sur une plage de largeur à peine.
Algorithmes usuels
Trois algorithmes répondent à cette question. Ils sont génériques : ils minimisent n'importe quelle loss, celle du MLE comme celle des moindres carrés, et ne supposent rien du problème d'estimation dont elle provient.
1. Recherche sur grille. Remplacer l'espace continu
La discrétisation la plus simple échantillonne régulièrement un intervalle
Elle ne demande aucune dérivée et ne peut pas se piéger dans un minimum local.
2. Descente de gradient. Se déplacer en sens inverse de la pente, d'un pas
3. Newton-Raphson. Exploiter en plus la courbure, ce qui permet d'atteindre le minimum en très peu d'itérations lorsque la loss est régulière :
En pratique, il est courant de combiner un grid search, pour obtenir une première valeur approximative, puis de raffiner cette valeur par une descente de gradient ou par l'algorithme de Newton-Raphson. La raison tient au comportement des deux méthodes itératives : elles descendent la pente sur laquelle elles sont lâchées, et convergent donc vers un minimum local, celui du bassin où se trouve leur point de départ.
Figure 2.5b, Descente de gradient depuis figures/ch2/02-gradient-init.py).
Figure 2.5c, Descente de gradient depuis
Pour illustrer le problème, les figures ci-dessus présentent la loss de la figure 2.5a, agrandie entre
7. Résumé
Quatre estimateurs ont été construits dans cette page, chacun par la minimisation d'une loss. Le tableau suivant les rassemble, avec les hypothèses que chacun exige.
| Estimateur | Loss | Hypothèses nécessaires |
|---|---|---|
| MLE | loi des données | |
| LSE | modèle de signal | |
| MAP | loi des données et prior | |
| Appris | forme de |
La colonne des hypothèses ordonne les estimateurs selon la connaissance qu'ils exigent du modèle. Le MAP demande la plus complète, la loi des données et le prior ; le MLE se contente de la loi des données ; le LSE ne suppose qu'un modèle de signal et un bruit additif ; l'estimateur appris ne requiert aucun modèle analytique, mais une base d'exemples, qui en tient alors lieu. Plus l'hypothèse disponible est forte, plus l'estimateur l'exploite ; quand elle fait défaut, ce sont les données d'apprentissage qui la remplacent.
