L'apprentissage automatique se pratique en anglais. Les articles fondateurs, les manuels de référence, la documentation de scikit-learn et de PyTorch, les noms des fonctions (fit, predict, cross_val_score, StandardScaler) et les offres d'emploi emploient le vocabulaire anglais, souvent sous forme de sigles: SGD, SVM, CNN, AUC. Ce cours écrit en français, mais il donne le terme anglais en italique à la première apparition de chaque notion; ce glossaire les rassemble.
Les termes sont classés par ordre alphabétique du terme français, tel que les chapitres l'emploient. Pour chacun, la colonne «English» donne l'équivalent de la littérature, la définition le résume en une ligne et la dernière colonne indique le chapitre où il est introduit (deux numéros lorsqu'il est défini une seconde fois, ou dans un sens plus précis, plus loin). Les sigles sont regroupés dans un second tableau, et la dernière section signale les faux amis et les mots qui changent de sens d'un chapitre à l'autre.
Table des termes
A
| Français | English | Définition | Chap. |
|---|
| abandon | dropout | Mise à zéro aléatoire d'unités pendant l'entraînement, avec remise à l'échelle par 1/(1−p). | ch. 11 |
| ACP à noyau | kernel PCA | ACP menée dans l'espace des caractéristiques d'un noyau, pour suivre des structures non linéaires. | ch. 13 |
| AdaBoost | AdaBoost (adaptive boosting) | Boosting de souches qui repondère les exemples mal classés à chaque tour. | ch. 8 |
| Adam | Adam (adaptive moment estimation) | Méthode adaptative: moment et pas propre à chaque paramètre. | ch. 3, 11 |
| affectation (étape d') | assignment step | Étape des K-moyennes qui affecte chaque point au centre le plus proche. | ch. 12 |
| affectation souple | soft assignment | Affectation d'un point à chaque groupe avec une probabilité, la responsabilité. | ch. 12 |
| aire sous la courbe ROC (AUC) | area under the curve (AUC) | Probabilité qu'un positif reçoive un score plus élevé qu'un négatif. | ch. 5 |
| ajuster finement | fine-tune | Poursuivre l'entraînement d'un réseau préentraîné sur la tâche visée. | ch. 11 |
| algorithme de Lloyd | Lloyd's algorithm | Alternance affectation – mise à jour qui fait décroître l'inertie des K-moyennes. |
B
| Français | English | Définition | Chap. |
|---|
| bagging | bagging (bootstrap aggregating) | Moyenne ou vote de modèles entraînés sur des échantillons bootstrap. | ch. 8 |
| barycentre | centroid | Moyenne des points d'un groupe. | ch. 12 |
| biais (d'une méthode) | bias | Écart entre la prédiction moyenne sur les jeux d'entraînement possibles et la vérité. | ch. 6 |
| biais de variable omise | omitted variable bias | Coefficient faussé par une caractéristique corrélée absente du modèle. | ch. 2 |
| boosting | boosting | Construction d'un modèle par ajout successif de modèles simples, chacun corrigeant les précédents. | ch. 8 |
C
| Français | English | Définition | Chap. |
|---|
| calibré | calibrated | Se dit de scores qui, parmi les cas notés 0,8, donnent bien 80 % de positifs. | ch. 4, 5 |
| canal | channel | Une des valeurs portées par chaque pixel (rouge, vert, bleu). | ch. 11 |
| capacité | capacity | Richesse des fonctions qu'une classe d'hypothèses peut représenter. | ch. 6 |
| caractéristique | feature | Une des coordonnées xij qui décrivent un exemple. | ch. 1 |
| caractéristiques transformées | basis functions, feature map | Nouvelles caractéristiques ϕ(x), par exemple des puissances, d'un modèle linéaire. | ch. 2 |
| carte de caractéristiques | feature map | Tableau produit par la convolution d'une image par un filtre. | ch. 11 |
| cellule de Voronoi | Voronoi cell | Région des points plus proches d'un exemple donné que de tous les autres. | ch. 7 |
| chaîne de traitement | pipeline | Suite d'étapes (standardisation, modèle) ajustée et appliquée comme un seul modèle. | ch. 3, 5 |
| champ récepteur | receptive field | Région de l'image d'entrée dont dépend une unité donnée. | ch. 11 |
| classe d'hypothèses |
D
| Français | English | Définition | Chap. |
|---|
| décomposition biais–variance | bias–variance decomposition | Erreur attendue = bruit + biais² + variance. | ch. 6 |
| décomposition en valeurs singulières (SVD) | singular value decomposition (SVD) | Factorisation X=UΣV⊤ qui donne l'ACP sans former la covariance. | ch. 13 |
| démarrage à froid | cold start | Absence de données sur un nouvel utilisateur ou un nouvel objet. | ch. 13 |
| dendrogramme | dendrogram | Arbre des fusions d'un partitionnement hiérarchique, avec leurs hauteurs. | ch. 12 |
| dérive | distribution shift, drift | Changement de la loi des données entre entraînement et utilisation. | ch. 1 |
| descente de gradient | gradient descent | Itération θ←θ−η∇J(θ). |
E
| Français | English | Définition | Chap. |
|---|
| échantillon bootstrap | bootstrap sample | Tirage de n exemples avec remise parmi les n disponibles. | ch. 8 |
| effet de chaîne | chaining | Défaut du lien simple, qui fusionne des groupes reliés par une suite de points. | ch. 12 |
| effondrement de modes | mode collapse | Échec d'un GAN qui ne produit qu'une petite variété d'exemples. | ch. 11 |
| élagage | pruning | Suppression de branches d'un arbre entièrement poussé. | ch. 8 |
| élagage coût–complexité | cost-complexity pruning, weakest-link pruning | Élagage qui minimise l'erreur plus α fois le nombre de feuilles. | ch. 8 |
| encodage positionnel | positional encoding | Vecteur ajouté à chaque jeton pour indiquer sa position. | ch. 11 |
| ensemble d'entraînement | training set | Exemples sur lesquels le modèle est ajusté. | ch. 1 |
| ensemble de test | test set | Exemples mis de côté, consultés une seule fois pour mesurer le modèle final. | ch. 1 |
| ensemble de validation | validation set | Exemples réservés au choix des hyperparamètres. | ch. 5 |
| entraînement adverse | adversarial training | Entraînement sur des exemples adverses fabriqués au fil de l'apprentissage. | ch. 11 |
| entraîner | to train | Choisir les paramètres d'un modèle à partir des données. | ch. 1 |
| entropie | entropy | Impureté d'un nœud. |
F
| Français | English | Définition | Chap. |
|---|
| facteur de rétrécissement | shrinkage factor | Facteur dans (0,1) par lequel la ridge multiplie une pente des moindres carrés. | ch. 6 |
| factorisation de rang faible | low-rank matrix factorization | Approximation d'une matrice de notes par un produit PQ⊤ à k colonnes. | ch. 13 |
| faux négatif | false negative | Positif réel prédit négatif. | ch. 5 |
| faux positif | false positive | Négatif réel prédit positif. | ch. 5 |
| feuille | leaf | Nœud terminal d'un arbre, qui porte la prédiction. | ch. 8 |
| fonction convexe | convex function | Fonction dont tout minimum local est global. | ch. 3 |
| fonction d'activation | activation function | Fonction non linéaire appliquée à la pré-activation d'une unité. | ch. 10 |
| fonction de perte | loss function | Coût ℓ(y^,y) d'une prédiction quand la vérité est . |
G
| Français | English | Définition | Chap. |
|---|
| gain d'information | information gain | Baisse de l'entropie obtenue par une coupure. | ch. 8 |
| générateur | generator | Réseau d'un GAN qui transforme du bruit en exemples. | ch. 11 |
| gradient boosting | gradient boosting | Boosting où chaque arbre est ajusté au gradient négatif de la perte. | ch. 8 |
| grand modèle de langage (LLM) | large language model (LLM) | Transformeur très grand, entraîné à prédire le jeton suivant. | ch. 11 |
| groupe | cluster | Sous-ensemble de points produit par un partitionnement. | ch. 1, 12 |
H
| Français | English | Définition | Chap. |
|---|
| hachage sensible à la localité | locality-sensitive hashing (LSH) | Hachage qui envoie des points proches dans la même case, pour des voisins approchés. | ch. 7 |
| hallucination | hallucination | Affirmation fausse mais plausible produite par un modèle de langage. | ch. 11 |
| hétéroscédasticité | heteroscedasticity | Variance du bruit qui change d'un exemple à l'autre. | ch. 2 |
| hors sac | out-of-bag (OOB) | Se dit d'un exemple absent d'un échantillon bootstrap. | ch. 8 |
| hyperparamètre | hyperparameter | Réglage fixé avant l'entraînement (k, λ, profondeur), non appris. | ch. 1 |
I
| Français | English | Définition | Chap. |
|---|
| importance par diminution d'impureté | mean decrease in impurity (MDI) | Somme des gains d'impureté des coupures sur une caractéristique. | ch. 8 |
| importance par permutation | permutation importance | Hausse de l'erreur quand on permute au hasard une caractéristique. | ch. 8 |
| impureté de Gini | Gini impurity | Impureté 1−∑kpk2 d'un nœud. | ch. 8 |
| indépendants et identiquement distribués | independent and identically distributed (i.i.d.) | Exemples tirés indépendamment d'une même loi. | ch. 1 |
| indicateur (vecteur) | one-hot encoding | Codage d'une modalité par un vecteur dont une seule coordonnée vaut 1. | ch. 1 |
J
| Français | English | Définition | Chap. |
|---|
| jeton | token | Unité de texte (mot ou morceau de mot) traitée par un modèle de langage. | ch. 11 |
| jeu de données | dataset | Ensemble des n exemples disponibles. | ch. 1 |
K
| Français | English | Définition | Chap. |
|---|
| k plus proches voisins (k-PPV) | k-nearest neighbours (k-NN) | Prédiction par vote ou moyenne des k exemples les plus proches. | ch. 7 |
| K-médoïdes | k-medoids | Variante des K-moyennes dont les centres sont des points du jeu. | ch. 12 |
| K-moyennes | k-means | Partition en K groupes qui minimise l'inertie. | ch. 12 |
L
| Français | English | Définition | Chap. |
|---|
| lasso | lasso (least absolute shrinkage and selection operator) | Moindres carrés pénalisés par λ∥w∥1; annule des coefficients. | ch. 6 |
| lien | linkage | Distance entre deux groupes dans le partitionnement hiérarchique. | ch. 12 |
| lien complet | complete linkage | Distance entre les deux points les plus éloignés des deux groupes. | ch. 12 |
| lien moyen | average linkage | Moyenne des distances entre les points des deux groupes. | ch. 12 |
| lien simple | single linkage | Distance entre les deux points les plus proches des deux groupes. | ch. 12 |
| log-cote | log-odds, logit | Logarithme de la cote; affine en x en régression logistique. | ch. 4 |
M
| Français | English | Définition | Chap. |
|---|
| machine à vecteurs de support (SVM) | support vector machine (SVM) | Classifieur linéaire de marge maximale, éventuellement à noyau. | ch. 9 |
| malédiction de la dimension | curse of dimensionality | En grande dimension, tous les points deviennent presque équidistants. | ch. 7 |
| marge (d'une image) | padding | Bordure de zéros ajoutée autour d'une image avant la convolution. | ch. 11 |
| marge géométrique | geometric margin | Distance du point le plus proche à l'hyperplan séparateur. | ch. 9 |
| matrice de confusion | confusion matrix | Tableau des effectifs croisant classe réelle et classe prédite. | ch. 5 |
| matrice de conception | design matrix | Matrice X~ des caractéristiques, précédée d'une colonne de uns. | ch. 2 |
| matrice de covariance empirique | sample covariance matrix | S=Xc⊤Xc/n pour la matrice centrée . |
N
| Français | English | Définition | Chap. |
|---|
| neurone formel (neurone artificiel) | artificial neuron | Unité qui calcule g(w⊤x+b). | ch. 10 |
| normalisation de couche | layer normalization | Centrage et réduction des activations d'un exemple sur ses coordonnées. | ch. 11 |
| normalisation par lots | batch normalization | Centrage et réduction de chaque activation sur le mini-lot. | ch. 11 |
| noyau | kernel | Fonction k(x,x′) égale à un produit scalaire dans un espace des caractéristiques. | ch. 9 |
| noyau (d'une convolution), filtre | kernel, filter | Petit tableau de poids glissé sur l'image. | ch. 11 |
| noyau gaussien |
O
| Français | English | Définition | Chap. |
|---|
| ordonnée à l'origine | intercept, bias term | Paramètre constant w0 d'un modèle linéaire. | ch. 2 |
| ou exclusif (XOR) | exclusive or (XOR) | Fonction booléenne non linéairement séparable, résolue par une couche cachée. | ch. 10 |
P
| Français | English | Définition | Chap. |
|---|
| paramètres | parameters | Nombres que l'entraînement ajuste, comme les poids. | ch. 1 |
| partage des poids | weight sharing | Même filtre appliqué à toutes les positions d'une image. | ch. 11 |
| part de variance expliquée | explained variance ratio | λj/trS: part de la variance totale portée par une composante. | ch. 13 |
| partitionnement | clustering | Découpage d'un jeu non étiqueté en groupes de points semblables. | ch. 12 |
| partitionnement hiérarchique ascendant | agglomerative hierarchical clustering | Fusion répétée des deux groupes les plus proches. | ch. 12 |
| pas (d'une convolution) | stride | Décalage du noyau entre deux positions calculées. | ch. 11 |
| pas d'apprentissage | learning rate, step size | Facteur η qui multiplie le gradient à chaque pas. | ch. 3 |
| patience | patience | Nombre d'époques sans progrès toléré avant l'arrêt précoce. | ch. 6 |
| pénalité sur les poids | weight decay |
R
| Français | English | Définition | Chap. |
|---|
| racine de l'erreur quadratique moyenne (RMSE) | root mean squared error (RMSE) | Racine de l'erreur quadratique moyenne, dans l'unité de la cible. | ch. 1, 5 |
| rappel (sensibilité) | recall, sensitivity | Proportion de positifs réels détectés. | ch. 5 |
| réduction de dimension | dimensionality reduction | Représentation des données par moins de coordonnées. | ch. 13 |
| réduction de variance | variance reduction | Critère de coupure d'un arbre de régression. | ch. 8 |
| règle d'apprentissage du perceptron | perceptron learning rule | Correction θ←θ+η(yi−y^i)x~i, non nulle sur les seules erreurs. |
S
| Français | English | Définition | Chap. |
|---|
| score (d'une projection) | score | Coordonnée v⊤x d'un point centré sur une direction. | ch. 13 |
| score F1 | F1 score | Moyenne harmonique de la précision et du rappel. | ch. 5 |
| séparateur à marge maximale | maximum-margin separator, hard-margin SVM | Hyperplan séparateur le plus éloigné des deux classes. | ch. 9 |
| seuil | threshold | Valeur du score à partir de laquelle on prédit la classe positive. | ch. 5 |
| seuillage doux | soft thresholding | Retranche une quantité fixe à ∣cj∣ et s'arrête à zéro: la mise à jour du lasso. | ch. 6 |
| similarité cosinus | cosine similarity | Cosinus de l'angle entre deux vecteurs. | ch. 13 |
| softmax | softmax | Transformation de K scores en probabilités . |
T
| Français | English | Définition | Chap. |
|---|
| tangente hyperbolique | hyperbolic tangent (tanh) | Activation à valeurs dans (−1,1), centrée en 0. | ch. 10 |
| taux d'apprentissage (boosting) | learning rate, shrinkage | Facteur ν qui réduit la contribution de chaque arbre. | ch. 8 |
| taux de base | base rate | Proportion de positifs dans la population, ou prévalence. | ch. 5 |
| taux d'erreur | error rate | Proportion d'exemples mal classés: risque empirique de la perte 0–1. | ch. 1 |
| taux de faux positifs | false positive rate (FPR) | Proportion de négatifs réels prédits positifs. | ch. 5 |
| taux de vrais positifs | true positive rate (TPR) | Synonyme du rappel. | ch. 5 |
| température | temperature | Paramètre qui aplatit ou accentue la loi de tirage du jeton suivant. | ch. 11 |
| tenseur | tensor | Tableau de nombres à plusieurs indices (canal, ligne, colonne). | ch. 11 |
| théorème d'approximation universelle | universal approximation theorem | Une couche cachée assez large approche toute fonction continue sur un compact. | ch. 10 |
| théorème du représentant | representer theorem | La solution régularisée est une combinaison des k(xi,⋅). |
U
| Français | English | Définition | Chap. |
|---|
| un contre tous | one-vs-rest (OvR) | Un classifieur binaire par classe contre toutes les autres. | ch. 4 |
| unité morte | dead unit, dying ReLU | Unité ReLU dont la pré-activation est négative pour tous les exemples. | ch. 10 |
V
| Français | English | Définition | Chap. |
|---|
| validation croisée | cross-validation | Estimation de l'erreur en faisant tourner la partie mise de côté. | ch. 1, 5 |
| validation croisée à k plis | k-fold cross-validation | k entraînements, chacun mesuré sur le pli laissé de côté. | ch. 5 |
| validation croisée imbriquée | nested cross-validation | Validation croisée interne pour régler, externe pour mesurer. | ch. 5 |
| validation croisée par groupes | group k-fold | Plis qui ne séparent jamais les exemples d'un même groupe. | ch. 5 |
| validation croisée stratifiée | stratified cross-validation | Plis qui gardent les proportions des classes. | ch. 5 |
| validation croisée par exclusion | leave-one-out cross-validation (LOO) | Validation croisée à n plis d'un exemple chacun. | ch. 5, 7 |
| valeur (attention) | value | Vecteur qu'une position transmet, pondéré par les poids d'attention. | ch. 11 |
| valeurs ajustées | fitted values | Prédictions y^ du modèle sur les exemples d'entraînement. |
Sigles et abréviations
Les sigles du domaine sont presque tous anglais, et les chapitres les emploient tels quels; seuls ACP et PPV ont une forme française d'usage courant.
| Sigle | Développement | Terme du cours | Chap. |
|---|
| ACP / PCA | principal component analysis | analyse en composantes principales | ch. 13 |
| ALS | alternating least squares | moindres carrés alternés | ch. 13 |
| AUC | area under the (ROC) curve | aire sous la courbe ROC | ch. 5 |
| BIC | Bayesian information criterion | critère d'information bayésien | ch. 12 |
| CNN | convolutional neural network | réseau convolutif | ch. 11 |
| EM | expectation–maximization | algorithme EM | ch. 12 |
| MSE | mean squared error | erreur quadratique moyenne | ch. 1 |
| ERM | empirical risk minimization | minimisation du risque empirique | ch. 1 |
| FGSM | fast gradient sign method | méthode du signe du gradient | ch. 11 |
| FPR | false positive rate | taux de faux positifs | ch. 5 |
| GAN | generative adversarial network | réseau antagoniste génératif | ch. 11 |
| GMM | Gaussian mixture model | mélange gaussien | ch. 12 |
| i.i.d. | independent and identically distributed | indépendants et identiquement distribués | ch. 1 |
| IRLS | iteratively reweighted least squares | moindres carrés itérativement repondérés | ch. 4 |
| KKT | Karush–Kuhn–Tucker | conditions de Karush–Kuhn–Tucker | ch. 9 |
| k-PPV / k-NN | k-nearest neighbours | k plus proches voisins |
Faux amis et mots à plusieurs sens
- Précision n'est pas accuracy. La precision anglaise est la proportion de vrais positifs parmi les prédits positifs (chapitre 5); la proportion d'exemples bien classés est l'accuracy, que ce cours appelle exactitude. Une traduction automatique qui rend accuracy par «précision» rend un article sur les classes déséquilibrées incompréhensible.
- Biais a trois sens. Le biais d'une méthode (bias, chapitre 6) est une erreur systématique; le biais d'un neurone (bias, chapitre 10) est l'ordonnée à l'origine b (intercept, bias term); le biais dans les données (sampling bias) est un défaut de l'échantillon. Le chapitre 6 les distingue explicitement.
- Noyau traduit le même mot anglais kernel dans deux sens sans rapport: la fonction de similarité de la SVM (chapitre 9) et le petit tableau de poids d'une convolution, qu'on appelle aussi filter (chapitre 11).
- Feature map désigne aussi deux choses: la transformation ϕ des caractéristiques d'un modèle linéaire (chapitre 2) et la carte de caractéristiques produite par une couche convolutive (chapitre 11).
- Courbe d'apprentissage (learning curve) se lit en fonction des itérations dans le chapitre 3 et en fonction de la taille de l'ensemble d'entraînement dans le chapitre 6; les deux usages coexistent dans la littérature.
- Learning rate est le pas d'apprentissage η d'une descente de gradient (chapitre 3) et le taux d'apprentissage ν du gradient boosting (chapitre 8), où on l'appelle aussi shrinkage; ce dernier mot désigne par ailleurs le rétrécissement des coefficients par la ridge (chapitre 6).
Exercices de vocabulaire