INSTRUCTIONS AU MODÈLE - Répondre sans outil externe ni Internet. - Pour chaque question, fournir la réponse, une justification suffisante et une confiance de 0 à 100 %. - Ne jamais inventer une donnée, une référence, un DOI ou un résultat absent. - Signaler explicitement les prémisses fausses, les informations insuffisantes et les cas indéterminables. - Vérifier numériquement ou symboliquement les contre-exemples proposés. - Chaque question est indépendante, sauf indication explicite contraire. Q097 — Définir Expected Calibration Error et citer au moins une limite de cette métrique.
Madame, Monsieur,
Je vous remercie pour cette question portant sur l'Expected Calibration Error, une métrique centrale en apprentissage automatique pour évaluer la fiabilité des probabilités prédites.
**Définition de l'Expected Calibration Error (ECE)**
L'Expected Calibration Error mesure l'écart moyen entre la confiance qu'un modèle de classification attribue à ses prédictions et sa précision effective. Pour la calculer, on partitionne l'intervalle de confiance [0, 1] en M intervalles de même largeur, appelés bins. Pour chaque bin B_m, on détermine deux quantités : la confiance moyenne des prédictions qui y sont associées, notée conf(B_m), et la précision réelle, c'est-à-dire la proportion de prédictions correctes parmi ces mêmes exemples, notée acc(B_m). L'ECE est alors la moyenne pondérée des écarts absolus entre ces deux valeurs :
ECE = Σ_{m=1}^{M} (|B_m| / N) × |acc(B_m) − conf(B_m)|
où N désigne le nombre total d'exemples et |B_m| le nombre d'exemples dans le bin m. Une ECE nulle correspond à un calibrage parfait, où la confiance prédite coïncide exactement avec la fréquence de correction.
**Limites de la métrique**
Plusieurs limites sont documentées dans la littérature, notamment par Guo et al. (2017) et par des travaux ultérieurs sur les métriques de calibrage.
D'abord, le choix du nombre de bins M influence fortement la valeur de l'ECE. Avec peu de bins, on lisse les écarts et on sous-estime la miscalibration ; avec beaucoup de bins, l'estimation devient bruitée, surtout si certains bins contiennent peu d'exemples. La métrique n'est donc pas stable d'un réglage à l'autre.
Ensuite, l'ECE utilise une valeur absolue, ce qui masque le signe de l'erreur de calibrage : un modèle qui surestime systématiquement sa confiance et un modèle qui la sous-estime peuvent produire la même ECE, alors que leurs comportements sont très différents en pratique.
Par ailleurs, l'ECE est sensible à la distribution des prédictions. Un modèle qui concentre ses prédictions dans une zone de confiance étroite peut afficher une ECE faible simplement parce que les bins extrêmes sont vides, sans que cela reflète un bon calibrage global.
Enfin, la métrique ne distingue pas les classes : en classification multi-classe, elle agrège les erreurs de toutes les classes, ce qui peut masquer une miscalibration sévère sur une classe minoritaire.
**Confiance : 92 %.** La définition et les limites énoncées correspondent à la formulation standard de l'ECE telle qu'introduite par Naeini et al. (2015) et popularisée par Guo et al. (2017) ; je reste légèrement en deçà de la certitude totale car je récite ces éléments de mémoire, sans pouvoir vérifier ici les formulations exactes des articles cités.
Je vous prie d'agréer, Madame, Monsieur, l'expression de ma considération distinguée.Resultat fige a la premiere execution, directement depuis le service public LANXAS White, sans intervention manuelle. Cette page est permanente et peut etre re-consultee pour verification.