INSTRUCTIONS AU MODÈLE - Répondre sans outil externe ni Internet. - Pour chaque question, fournir la réponse, une justification suffisante et une confiance de 0 à 100 %. - Ne jamais inventer une donnée, une référence, un DOI ou un résultat absent. - Signaler explicitement les prémisses fausses, les informations insuffisantes et les cas indéterminables. - Vérifier numériquement ou symboliquement les contre-exemples proposés. - Chaque question est indépendante, sauf indication explicite contraire. Q030 — Un classifieur donne précision=1 et rappel=0.1 sur la classe positive. Peut-il néanmoins avoir une forte accuracy ? Construire un exemple.
Je vous remercie pour cette question, qui touche à la relation entre précision, rappel et exactitude (accuracy) en classification. Réponse Oui, un classifieur peut tout à fait avoir une précision de 1 et un rappel de 0,1 sur la classe positive tout en affichant une accuracy très élevée. Cela se produit lorsque la classe positive est très minoritaire : le classifieur prédit presque toujours la classe négative, ce qui lui donne un rappel très faible sur la classe positive, mais comme la grande majorité des exemples sont réellement négatifs, ses prédictions négatives sont massivement correctes. Construction de l'exemple Considérons un jeu de données de 1000 exemples, dont 100 réellement positifs et 900 réellement négatifs. Le classifieur prédit la classe positive pour seulement 10 exemples, tous correctement (donc 10 vrais positifs), et prédit la classe négative pour les 990 autres. Définissons les quatre cellules de la matrice de confusion. Les vrais positifs (VP) valent 10. Le rappel étant le rapport des vrais positifs sur le total des positifs réels, on a rappel = VP / (VP + FN) = 10 / 100 = 0,1, ce qui impose 90 faux négatifs (FN). La précision étant le rapport des vrais positifs sur le total des prédictions positives, on a précision = VP / (VP + FP) = 10 / 10 = 1, ce qui impose 0 faux positif (FP). Enfin, parmi les 900 négatifs réels, 0 ont été mal classés, donc les vrais négatifs (VN) valent 900. La matrice de confusion est donc : VP = 10, FN = 90, FP = 0, VN = 900. L'accuracy se calcule comme la proportion de prédictions correctes : (VP + VN) / total = (10 + 900) / 1000 = 0,91, soit 91 %. Vérification des contraintes La précision vaut bien 10 / (10 + 0) = 1. Le rappel vaut bien 10 / (10 + 90) = 0,1. L'accuracy vaut bien 0,91. Toutes les valeurs sont cohérentes et les trois métriques sont simultanément satisfaites. Interprétation Cet exemple illustre le piège classique des métriques sur données déséquilibrées : une accuracy de 91 % semble excellente, mais le classifieur ne détecte que 10 % des cas positifs, ce qui peut être catastrophique selon l'application (par exemple en dépistage médical ou en détection de fraude). La précision parfaite n'est ici qu'un artefact : le classifieur ne prédit presque jamais la classe positive, donc il ne commet presque jamais d'erreur sur cette classe. C'est pourquoi, sur des données déséquilibrées, l'accuracy seule est trompeuse et il faut examiner la précision, le rappel et le F1-score conjointement. Confiance : 97 %. La construction est vérifiée numériquement et les définitions des trois métriques sont appliquées exactement ; la marge restante tient à la formulation des définitions standards, que je récite de mémoire. Je reste à votre disposition pour approfondir, par exemple sur le choix d'une métrique adaptée aux données déséquilibrées.
Resultat fige a la premiere execution, directement depuis le service public LANXAS White, sans intervention manuelle. Cette page est permanente et peut etre re-consultee pour verification.