Quantile, Quartile
Un quantile est une valeur seuil qui divise la plage de valeurs d’une distribution de probabilité ou d’un échantillon de données en intervalles continus contenant des proportions égales de probabilités ou d’observations. Les quantiles sont des points de coupure spécifiques dans un ensemble de données ordonné. Le terme générique « quantile » est utilisé pour décrire toute division de ce type. Les quartiles sont un cas particulier et très courant de quantiles, qui divisent spécifiquement les données ordonnées en quatre parties égales.
Les concepts fondamentaux derrière les quantiles reposent sur l’idée d’ordonner un ensemble de données, du plus petit au plus grand, puis de trouver les valeurs qui séparent cet ensemble ordonné en un certain nombre de sous-ensembles de tailles égales (ou aussi égales que possible pour les données discrètes). Pour un quantile d’ordre *p* (ou *p*-quantile), où *p* est une proportion comprise entre 0 et 1, il s’agit de la valeur en dessous de laquelle une proportion *p* des observations se situe. Par exemple, le 0.5-quantile est la valeur qui divise les données en deux moitiés égales ; c’est la médiane. Les quartiles sont les quantiles correspondant aux proportions 0.25, 0.50 et 0.75. Le premier quartile (Q1) est le 0.25-quantile, la valeur en dessous de laquelle 25% des données se trouvent. Le deuxième quartile (Q2) est le 0.50-quantile, qui est la médiane, séparant les 50% inférieurs des 50% supérieurs. Le troisième quartile (Q3) est le 0.75-quantile, la valeur en dessous de laquelle 75% des données se trouvent.
L’importance des quantiles et des quartiles réside dans leur capacité à résumer la distribution d’un ensemble de données au-delà de la simple mesure de tendance centrale comme la moyenne. Ils fournissent des informations sur la dispersion et la forme (symétrie ou asymétrie) de la distribution. Contrairement à la moyenne et à l’écart type, les quantiles (en particulier la médiane et les quartiles) sont des statistiques robustes, c’est-à-dire qu’ils sont moins sensibles aux valeurs extrêmes (outliers). Cela les rend particulièrement utiles dans les domaines où les données peuvent être bruitées ou contenir des anomalies, comme en économie, en finance, en sciences sociales, en sciences de l’environnement et en ingénierie. Ils sont essentiels pour comprendre où se situe une observation particulière par rapport au reste de l’ensemble des données.
Les applications pratiques des quantiles et des quartiles sont nombreuses. En statistique descriptive, les quartiles (Q1, Q2, Q3) sont les éléments clés de la construction des diagrammes en boîte (box plots), qui visualisent la distribution, la tendance centrale, la dispersion (via l’écart interquartile, IQR = Q3 – Q1) et les valeurs aberrantes potentielles. En finance, les quantiles sont utilisés pour évaluer le risque, par exemple avec la Valeur à Risque (VaR), qui est typiquement un quantile élevé (par exemple, le 0.95 ou 0.99-quantile) de la distribution des pertes potentielles. En économie, les quantiles comme les déciles (division en 10 parties) ou les quintiles (division en 5 parties) sont utilisés pour analyser la répartition des revenus ou des richesses au sein d’une population. En éducation, les résultats des tests standardisés sont souvent rapportés en termes de percentiles (quantiles divisant les données en 100 parties), indiquant le pourcentage de candidats ayant obtenu un score inférieur. Dans le domaine de la santé, les courbes de croissance des enfants utilisent des percentiles pour comparer la taille et le poids d’un enfant à ceux d’une population de référence. Un exemple simple : pour l’ensemble de données ordonné {1, 3, 4, 6, 8, 9, 10}, Q1 est 3 (la médiane de la moitié inférieure {1, 3, 4}), Q2 (la médiane) est 6, et Q3 est 9 (la médiane de la moitié supérieure {8, 9, 10}).
Il existe différentes nuances et méthodes de calcul pour les quantiles, en particulier pour les petits échantillons ou les données discrètes. Différents logiciels statistiques (comme R, SAS, Python) peuvent implémenter légèrement différentes définitions ou algorithmes pour estimer les quantiles à partir d’un échantillon, ce qui peut conduire à des valeurs légèrement différentes pour Q1 et Q3 notamment. Ces différences proviennent de la manière dont l’interpolation est effectuée entre les points de données discrets. Il est donc important de connaître la méthode spécifique utilisée lors de la comparaison des résultats. Les quantiles peuvent être définis pour des distributions théoriques (quantiles de population) ou estimés à partir d’échantillons de données (quantiles d’échantillon). Outre les quartiles, d’autres types de quantiles sont couramment utilisés : les percentiles (100 divisions), les déciles (10 divisions), les quintiles (5 divisions), et parfois les tertiles (3 divisions). Le terme « fractile » est parfois utilisé comme synonyme de quantile.
Les concepts étroitement liés aux quantiles et quartiles incluent la médiane (qui est Q2), l’écart interquartile (IQR = Q3 – Q1, une mesure de dispersion robuste), les percentiles, déciles, quintiles, les statistiques d’ordre (les valeurs ordonnées elles-mêmes), la fonction de répartition empirique (ECDF), et le diagramme en boîte (box plot). Les quantiles sont des mesures de position ou de localisation au sein d’une distribution, contrastant avec des mesures de tendance centrale comme la moyenne ou des mesures de dispersion comme l’écart type ou la variance, bien que l’IQR soit dérivé des quartiles et serve de mesure de dispersion. Il n’y a pas d’antonymes directs, mais on peut opposer leur robustesse à la sensibilité de la moyenne aux valeurs extrêmes.
L’origine du concept de quantile remonte aux travaux pionniers de Sir Francis Galton à la fin du 19ème siècle. Galton a introduit les notions de médiane et de quartiles dans ses études sur l’hérédité et l’anthropométrie. Le terme « percentile » a également été popularisé par Galton. Le développement formel et l’utilisation généralisée des quantiles en statistique se sont poursuivis tout au long du 20ème siècle, devenant des outils fondamentaux de l’analyse exploratoire des données et de la statistique non paramétrique.
Les avantages des quantiles et quartiles incluent leur robustesse aux valeurs extrêmes, leur facilité d’interprétation (surtout pour les quartiles et percentiles), leur applicabilité aux données ordinales et aux distributions non normales (asymétriques), et leur rôle central dans des outils descriptifs comme les box plots et l’IQR. Cependant, ils présentent aussi des limitations. Leur calcul peut varier légèrement selon la méthode choisie, ce qui peut prêter à confusion. Comparés à la moyenne et à l’écart type, ils peuvent être moins efficaces (c’est-à-dire avoir une plus grande variance d’échantillonnage) pour estimer les paramètres de certaines distributions, notamment la distribution normale. De plus, en se concentrant sur des points spécifiques de la distribution ordonnée, ils ne tiennent pas compte de la valeur précise de chaque observation de la même manière que la moyenne, ce qui peut être vu comme une perte d’information dans certains contextes. Néanmoins, leur capacité à fournir un résumé significatif de la distribution, en particulier en présence d’asymétrie ou d’outliers, en fait des outils statistiques indispensables.