Notions de maths

Variance et écart-type : un exemple calculé pas à pas

5 octobre 202610 min de lecture
Variance et écart-type : un exemple calculé pas à pas

Deux groupes terminent un puzzle en quatre minutes en moyenne. Dans le premier, tout le monde termine en quatre minutes. Dans le second, la moitié termine en deux minutes et l'autre en six. Les moyennes sont égales, mais les temps du second groupe sont plus dispersés. La variance et l'écart-type chiffrent cette différence.

Ces deux mesures décrivent la même caractéristique, la dispersion autour de la moyenne, mais sur des échelles différentes. La variance utilise des unités au carré. L'écart-type en prend la racine carrée et revient aux unités de départ. Si les données sont en minutes, la variance est en minutes carrées et l'écart-type en minutes. Le calcul change également selon que les données couvrent toute une population ou seulement un échantillon.

Nous allons parcourir une série de données du début à la fin. Si vous avez d'abord besoin de replacer moyennes, médianes et distributions dans leur contexte, lisez notre introduction aux statistiques.

Commencez par les écarts à la moyenne

Supposons que huit essais du puzzle ont pris les durées suivantes, en minutes :

2, 4, 4, 4, 5, 5, 7, 92,\ 4,\ 4,\ 4,\ 5,\ 5,\ 7,\ 9

Leur somme est 4040 minutes, donc la moyenne est 40/8=540/8=5 minutes. Soustrayez ensuite cinq à chaque durée. Les écarts sont :

−3, −1, −1, −1, 0, 0, 2, 4-3,\ -1,\ -1,\ -1,\ 0,\ 0,\ 2,\ 4

Un écart négatif signifie plus rapide que la moyenne ; un écart positif, plus lent. Ces écarts s'additionnent à zéro, comme le font toujours les écarts à une moyenne arithmétique. Leur simple moyenne annoncerait donc une dispersion nulle même pour des valeurs très différentes. Cela n'aiderait pas. Mettre chaque écart au carré le rend non négatif et donne davantage de poids aux valeurs éloignées, comme l'explique la référence du NIST sur les mesures de dispersion.

Voici les huit écarts mis au carré :

Temps, minutesÉcart à 5, minutesÉcart au carré, minutes²
2-39
4-11
4-11
4-11
500
500
724
9416

La dernière colonne totalise 3232 minutes carrées. Cette somme sert de base aux deux mesures. Rien ne change désormais dans les temps observés. Le dénominateur dépend de ce que représentent ces huit temps.

Si ces valeurs constituent toute la population

Imaginez que les huit essais sont tous ceux du petit concours qui vous intéresse. Vous décrivez ce groupe complet, sans estimer un groupe invisible plus grand. Divisez la somme des écarts au carré par le nombre de valeurs, N=8N=8 :

σ2=∑i=1N(xi−μ)2N=328=4 minutes2\sigma^2=\frac{\sum_{i=1}^{N}(x_i-\mu)^2}{N}=\frac{32}{8}=4\ \text{minutes}^2

Voilà la variance de population, de symbole σ2\sigma^2. Prenez ensuite la racine carrée :

σ=σ2=4=2 minutes\sigma=\sqrt{\sigma^2}=\sqrt{4}=2\ \text{minutes}

Voilà l'écart-type de population. La racine carrée n'annule pas le calcul pour produire la distance absolue moyenne. Elle ramène les unités et l'échelle d'origine, après que les écarts ont déjà été mis au carré et combinés. La section d'OpenStax sur la dispersion emploie les mêmes symboles et le même dénominateur pour la population.

Que signifient ici deux minutes ? C'est une mesure de la dispersion des temps autour de la moyenne de cinq minutes, exprimée en minutes. Cela ne veut pas dire que chaque résultat se trouve à moins de deux minutes de cinq : cette liste contient deux et neuf. Cela n'impose pas non plus qu'une proportion donnée des résultats soit dans cet intervalle. Ces règles de pourcentage nécessitent des hypothèses sur la distribution, pas seulement un écart-type calculé.

Si ces valeurs sont un échantillon

Supposez maintenant que ces mêmes huit temps ont été tirés d'un ensemble d'essais beaucoup plus grand et que vous voulez estimer la variabilité de cette population plus vaste. La moyenne observée de cinq vient elle aussi de l'échantillon. La variance d'échantillon usuelle utilise n−1n-1 au dénominateur :

s2=∑i=1n(xi−xˉ)2n−1=327≈4.5714 minutes2s^2=\frac{\sum_{i=1}^{n}(x_i-\bar{x})^2}{n-1}=\frac{32}{7}\approx4.5714\ \text{minutes}^2

L'écart-type d'échantillon vaut :

s=s2=327≈2.1381 minutess=\sqrt{s^2}=\sqrt{\frac{32}{7}}\approx2.1381\ \text{minutes}

Le résultat est un peu plus grand que dans le calcul de population, car la même somme, 3232, est divisée par sept au lieu de huit. Il ne s'agit pas de choisir une formule généreuse ou sévère. Il s'agit de répondre à deux questions : décrire les huit valeurs comme un groupe complet ou utiliser huit observations pour estimer la dispersion d'un groupe plus grand. Le manuel de science des données d'OpenStax présente les deux formules et la différence d'unités.

Pourquoi sept ? La moyenne de l'échantillon est ajustée à ces mêmes observations, ce qui tend à rendre leurs écarts plus petits que ceux à la moyenne inconnue de la population. Employer n−1n-1 corrige cette tendance à sous-estimer la variance, dans le cadre usuel de l'échantillonnage. Pour s'en souvenir : une fois la moyenne de l'échantillon fixée, sept écarts peuvent varier librement ; le huitième doit rendre leur somme nulle. La raison statistique plus profonde concerne le comportement de la variance d'échantillon sur des échantillons répétés. Ici, retenez la règle pratique : déterminez si vous avez une population ou un échantillon avant de diviser.

Quel nombre faut-il présenter ?

Utilisez la variance si un calcul demande une dispersion au carré ou si vous poursuivez avec une formule statistique définie à partir de la variance. Utilisez l'écart-type si vous voulez que le lecteur compare la dispersion aux mesures initiales. « Un écart-type d'environ 2.14 minutes » se compare immédiatement à une moyenne de cinq minutes ; « une variance d'environ 4.57 minutes carrées » est mathématiquement exacte, mais moins facile à se représenter.

Indiquez toujours la convention. « Écart-type = 2 » et « écart-type = 2.14 » viennent tous deux des huit mêmes temps. Sans préciser population ou échantillon, le lecteur ne peut pas comprendre la différence. Si votre calculatrice propose σ\sigma et ss, ces touches ne sont pas interchangeables. Choisissez σ\sigma pour décrire la population complète et ss pour le calcul sur un échantillon.

L'unité compte aussi. Si les valeurs sont en centimètres, la variance utilise cm2\mathrm{cm}^2 et l'écart-type des centimètres. Si les valeurs sont des scores sans unité, les deux résultats sont sans unité. Appeler les deux nombres « points » ou les deux « points carrés » masque l'effet de la racine carrée.

Pourquoi ne pas utiliser seulement l'étendue ?

L'étendue de nos temps est 9−2=79-2=7 minutes. Elle indique l'écart entre les extrêmes, mais rien sur les six valeurs intermédiaires. Modifiez une valeur du milieu sans toucher à deux ni à neuf : l'étendue reste sept, même si l'ensemble des données change. Variance et écart-type utilisent toutes les observations ; ces changements intermédiaires influent donc sur le résultat.

Cet atout s'accompagne d'une limite : le carré donne beaucoup de poids aux valeurs éloignées. Dans les données calculées, l'essai de neuf minutes contribue à lui seul 1616 des 3232 minutes carrées au total. Cela peut être utile quand une grande différence compte, mais il faut regarder les données avant d'interpréter une seule mesure de dispersion. Le NIST signale cet effet plus fort des grands écarts dans sa comparaison des mesures. Un écart-type ne remplace pas le repérage d'une valeur inhabituelle ou d'une distribution asymétrique.

Pour vous faire une idée, comparez deux séries de quatre valeurs, toutes deux de moyenne quatre : [4,4,4,4][4,4,4,4] et [2,2,6,6][2,2,6,6]. Dans la première, tous les écarts au carré et l'écart-type valent zéro. Dans la seconde, chaque valeur est distante de deux unités de quatre, donc chaque écart au carré vaut quatre. Si chaque série est traitée comme une population complète, sa variance vaut quatre et son écart-type deux. La moyenne commune cachait toute la différence.

Erreurs courantes de calcul

Diviser avant de savoir ce que représentent les données. Écrivez « population » ou « échantillon » en haut du calcul. Pour une population, utilisez NN ; pour une variance d'échantillon destinée à estimer la population, utilisez n−1n-1. Confondre les deux explique très souvent pourquoi deux réponses qui semblent correctes diffèrent.

Oublier la racine carrée. La somme divisée par le dénominateur donne la variance. L'écart-type est la racine carrée de ce nombre. Donnez les deux si l'exercice demande les deux.

Oublier les unités. La somme des écarts au carré et la variance ont des unités au carré ; l'écart-type a les unités d'origine. C'est un moyen rapide de vérifier votre travail.

L'appeler distance absolue moyenne. C'est une autre mesure, l'écart absolu moyen. Pour l'écart-type, on met d'abord au carré, puis on fait la moyenne avec la convention de population ou d'échantillon avant de prendre la racine carrée. Ces opérations donnent généralement une autre valeur.

Arrondir chaque ligne. Conservez les écarts au carré et la fraction exacte aussi longtemps que possible. Pour ces données, 32/732/7 donne un écart-type d'échantillon plus exact qu'une racine carrée prise sur une variance déjà arrondie.

Entraînez-vous sans recopier le tableau

Essayez [1,3,3,5][1,3,3,5] en traitant les quatre valeurs comme une population complète. La moyenne est 33. Les écarts sont [−2,0,0,2][-2,0,0,2] et la somme de leurs carrés vaut 88. La variance de population est 8/4=28/4=2 unités carrées et l'écart-type de population est 2≈1.4142\sqrt{2}\approx1.4142 unités. Si ces quatre valeurs constituent plutôt un échantillon, divisez par trois : variance d'échantillon 8/3≈2.66678/3\approx2.6667 et écart-type d'échantillon 8/3≈1.6330\sqrt{8/3}\approx1.6330.

Remplacez seulement la dernière valeur, cinq, par neuf. Avant de calculer, prédisez si la dispersion augmentera. Oui, mais refaites toute l'arithmétique : la moyenne a elle aussi changé, donc vous ne pouvez pas mettre à jour une seule ligne de l'ancien tableau des écarts. C'est un bon entraînement pour voir pourquoi moyenne et dispersion se calculent ensemble.

Les exercices de statistiques de Math Zen sont utiles une fois que vous savez remplir un tableau à la main. Entraînez-vous à trouver la moyenne, à choisir le bon dénominateur et à vérifier les unités de votre réponse. Si la distinction échantillon-population vous paraît encore abstraite, notre guide sur les probabilités explique pourquoi un échantillon sert à raisonner sur un ensemble de résultats plus large.

Questions fréquentes

La variance est-elle toujours supérieure à l'écart-type ?

Non. Les unités sont différentes, donc une comparaison directe « plus grand ou plus petit » n'a généralement pas de sens. Numériquement, si une variance est inférieure à un dans une unité choisie, sa racine carrée est plus grande que cette variance ; si elle dépasse un, sa racine carrée est plus petite. Changer d'unité peut modifier cette comparaison numérique sans modifier les données.

L'écart-type peut-il être négatif ?

Non. Les écarts au carré sont non négatifs, leur somme aussi, et la racine carrée utilisée pour l'écart-type est non négative. Il vaut zéro seulement si toutes les valeurs observées sont égales.

Quand dois-je utiliser n moins 1 ?

Utilisez n−1n-1 pour la variance et l'écart-type usuels d'échantillon lorsque la moyenne de l'échantillon est calculée à partir de ces données. Utilisez NN quand les données constituent toute la population que vous souhaitez décrire. Lisez l'énoncé avant de toucher à la calculatrice.

Quel est le moyen le plus simple de retenir la différence ?

La variance mesure la dispersion au moyen des écarts au carré. L'écart-type est sa racine carrée et revient aux unités de départ des données. Dans l'exemple, on passe de 3232 minutes carrées au total à 44 minutes carrées de variance de population, puis à 22 minutes d'écart-type de population.

Questions fréquentes

Quelle différence y a-t-il entre variance et écart-type ?
Pour une population, la variance est la moyenne des écarts à la moyenne mis au carré ; pour un échantillon, on divise la somme de ces carrés par n moins 1. L'écart-type est la racine carrée de la variance correspondante et retrouve donc l'unité des données.
Pourquoi la variance d'échantillon divise-t-elle par n moins 1 ?
La moyenne de l'échantillon est estimée à partir de ces mêmes données. Diviser la somme des écarts au carré par n moins 1 corrige la sous-estimation habituelle de la variance de population lorsqu'on l'estime à partir de l'échantillon. Pour une population complète, on divise par N.
L'écart-type est-il la distance moyenne à la moyenne ?
Non. On met les écarts au carré, on les moyenne avec le dénominateur adapté, puis on prend la racine carrée. L'écart absolu moyen moyenne plutôt les distances absolues. Les deux mesurent la dispersion, mais donnent des nombres différents.

Passer à la pratique