Modèle linéaire, moindres carrés, régularisation
La page précédente a montré que le MLE, sous bruit Gaussien blanc, minimise une erreur quadratique, sans jamais expliciter sa solution quand le modèle est linéaire en
1. Le modèle linéaire
Reprenons la situation qui ouvre le chapitre : un voltmètre bruité mesure
Forme scalaire, puis forme matricielle
Sous forme scalaire, le modèle linéaire général s'écrit :
où :
est la -ième sortie mesurée, sont les composantes du modèle : des séquences connues, désignant la -ième valeur de la composante , sont les paramètres inconnus à estimer, est le bruit de mesure.
Ce modèle marque le passage au multidimensionnel : non plus un
Empiler les
Modèle linéaire
où :
est le vecteur des sorties, (dimension , connue, de rang plein, ) porte le modèle : sa colonne empile les valeurs de la composante , , est le vecteur des paramètres.
Exemples
Le modèle linéaire est fréquemment rencontré en ingénierie. Les exemples suivants montrent la polyvalence de ce modèle.
Estimation d'une composante continue
- Forme scalaire :
- Forme matricielle :
Régression linéaire
- Forme scalaire :
- Forme matricielle :
Régression polynomiale d'ordre
- Forme scalaire :
- Forme matricielle, illustrée pour
( colonnes, une par puissance de l'instant, de à ) ; le passage à un quelconque ne fait qu'ajouter des colonnes de la même manière :
Cette matrice, dont chaque colonne élève les instants à une puissance croissante, se nomme matrice de Vandermonde (np.vander en NumPy). La régression polynomiale est l'illustration principale de cette page : elle reviendra à chaque section.
Estimation des coefficients d'un filtre FIR
- Forme scalaire, avec
un signal d'entrée connu et la convention pour :
- Forme matricielle :
Cette matrice
2. Estimation des paramètres
Hypothèses
Pour estimer
Nous retenons l'estimateur des moindres carrés qui, lorsque le bruit est Gaussien i.i.d., est équivalent à l'estimateur MLE.
Expression
Proposition, Solution des moindres carrés
où :
est la pseudo-inverse de .
Démonstration
Rappel de dérivation matricielle. Pour
La solution. En développant
Annuler le gradient donne
soit les équations normales
Notons qu'en pratique l'inverse np.linalg.lstsq(H, x) ou np.linalg.solve(H.T H, H.T x).
Propriétés
Propriétés
Démonstration
1. Sans biais, covariance
2. Atteint la CRLB. La log-vraisemblance est
3. C'est la solution des moindres carrés. Un ingénieur cherchant, sans formuler aucune hypothèse Gaussienne, le
Interprétation géométrique
Le produit
où :
est le projecteur orthogonal sur ( , ).
Géométriquement, le résidu
Figure 2.6, Géométrie des moindres carrés : figures/ch2/03-projection-geometrie.py).
Exemple : régression polynomiale d'ordre 4
Reprenons la régression polynomiale du §1, avec
Figure 2.7, Régression polynomiale d'ordre 4 ajustée par moindres carrés sur figures/ch2/03-regression-polynomiale-exemple.py).
Malgré un bruit d'écart-type 1, la régression retrouve fidèlement l'allure du signal : les coefficients estimés,
import numpy as np
rng = np.random.default_rng(2026)
N, L = 25, 4
n = np.arange(N) - (N - 1) / 2 # instants centrés : conditionnement de H bien meilleur
H = np.column_stack([n**l for l in range(L + 1)])
theta_star = np.array([3.0, 0.4, -0.05, 0.0, 0.0002])
x = H theta_star + rng.normal(0.0, 1.0, N)
theta_hat, *_ = np.linalg.lstsq(H, x, rcond=None)
theta_hat
# >>> array([ 3.0479, 0.3298, -0.0543, 0.0008, 0.0002])H = np.vander(n, L + 1, increasing=True) # équivalent à la boucle ci-dessus, plus concis
theta_hat, *_ = np.linalg.lstsq(H, x, rcond=None)3. Le modèle sur fonctions de base
En dehors de quelques cas simples, une sortie réelle s'écrit rarement directement sous forme linéaire. Une solution consiste à projeter d'abord l'entrée par une fonction non linéaire connue, puis à rester linéaire dans cet espace projeté. Cette technique augmente la capacité du modèle sans quitter le cadre des moindres carrés.
Notons
Hypothèses
Les échantillons reçus peuvent se décomposer sous la forme :
Sous forme matricielle, le modèle reste linéaire :
où :
sont fonctions connues de l'entrée, les fonctions de base (linear basis functions), , avec la colonne .
Chaque
Figure 2.8, Chaîne du modèle sur fonctions de base : l'entrée figures/ch2/03-schema-fonctions-base.tex).
Exemples : trois familles de bases
À titre d'exemple, les modèles suivants montrent différents choix de fonctions de base.
Base polynomiale
- la composante continue, la droite et la régression polynomiale du §1 en sont des cas particuliers (avec
).
Base de Fourier
Les fonctions trigonométriques forment la deuxième famille classique. Le cas le plus simple est l'estimation des amplitudes d'une somme de sinusoïdes de pulsations
Base gaussienne
où :
est le centre de la -ième fonction de base, est leur largeur, commune.
Par exemple,
Figure 2.9, Trois représentants de chaque famille de fonctions de base sur figures/ch2/03-fonctions-de-base.py).
Expression
Proposition, Solution des moindres carrés
où :
est la matrice de Gram des fonctions de base, de dimension . Son terme est le produit scalaire de deux fonctions de base échantillonnées sur les entrées :
La matrice de Gram est symétrique et positive. Elle n'est inversible que si les fonctions de base sont linéairement indépendantes une fois échantillonnées sur les
Surapprentissage
Les fonctions de base rendent l'enrichissement du modèle trivial : une fonction de base de plus est une colonne de plus dans np.vander. Prenons
Figure 2.10, Régression polynomiale d'ordre figures/ch2/03-surapprentissage-ordre.py).
Lorsque nous augmentons l'ordre, la covariance
Confusion classique
« Plus de paramètres, donc un meilleur modèle. » Non : plus de paramètres améliore toujours l'ajustement aux données observées, jamais nécessairement l'écart au signal vrai. Le premier se mesure sur les points déjà acquis, le second sur ce que le modèle prétend prédire ; la figure 2.10 les montre évoluer en sens contraires dès
4. La régularisation
Principe
Le polynôme de degré 12 du §3 pose un problème :
Expression
Pour le modèle linéaire à bruit Gaussien blanc, le terme d'attache aux données de
Régularisation
L'estimateur MAP minimise la loss des données augmentée d'un terme de régularisation :
où
et où
Exemple de prior
Le choix du prior est un choix de régularisation, exactement comme le choix du bruit était un choix de loss (§3 de la page précédente). Trois priors classiques, i.i.d. sur les composantes de
| Prior sur | Nom | Effet | |
|---|---|---|---|
| Gaussien | Ridge (L2) | rétrécit tous les coefficients, solution analytique | |
| Laplace | LASSO (L1) | annule certains coefficients, parcimonie, pas de solution analytique | |
| aucune loi propre (heuristique) | Sélection de sous-ensemble (L0) | parcimonie exacte, mais combinatoire ( |
Le cas Gaussien admet une solution fermée : c'est la régression ridge.
Proposition, Solution de la régression ridge
où :
est le poids de régularisation, hérité du prior ( ).
Démonstration
En annulant le gradient de
d'où la solution
La matrice
Le prior Laplace produit le même rétrécissement, mais annule exactement certains coefficients plutôt que de les réduire : c'est la parcimonie, exploitée par le LASSO pour sélectionner des variables. Le prix en est la perte de la solution analytique : la minimisation devient numérique, comme au §6 de la page précédente. Le critère idéal, pénaliser
Exemple : régression polynomiale
Reprenons exactement le polynôme de degré 12 du §3 (
Figure 2.11, Régression ridge de degré 12 sur les figures/ch2/03-ridge-lambda.py).
À
Le compromis se lit numériquement, pas seulement visuellement : l'écart au signal vrai (RMSE) vaut
