- Distinguer population et échantillon; reconnaître un échantillon représentatif.
- Identifier différentes méthodes d'échantillonnage.
- Organiser des données brutes en tableau de distribution (fréquences, fréquences relatives, fréquences cumulées).
- Construire et interpréter un histogramme.
Avant même de calculer quoi que ce soit, la première tâche d'une personne qui travaille avec des données est souvent de les visualiser. Un tableau de centaines de chiffres est difficile à interpréter d'un seul coup d'œil; un bon graphique, lui, peut révéler une tendance en une fraction de seconde.
La plupart des graphiques statistiques que tu utiliseras dans ce cours — le diagramme à bandes, le diagramme circulaire (le fameux « pointe de tarte ») et le diagramme à ligne brisée — ont été inventés par une seule et même personne : l'ingénieur et économiste écossais William Playfair, à la fin du 18e siècle. Playfair, qui a mené une vie mouvementée, publie en 1786 son Commercial and Political Atlas, où il utilise pour la première fois des graphiques à bandes et à lignes pour représenter des données économiques britanniques. Avant lui, presque personne n'avait eu l'idée de remplacer des colonnes de chiffres par des images.
Chaque fois que tu vois un graphique (dans un journal, sur les réseaux sociaux, dans une publicité), pose-toi trois questions : (1) Que représente chaque axe, et avec quelles unités? (2) L'échelle commence-t-elle vraiment à zéro, ou a-t-elle été « coupée » pour exagérer une différence? (3) Est-ce que le graphique choisi (bandes, lignes, cercle) convient réellement au type de données présentées? Ce réflexe te protégera de bien des statistiques trompeuses.
La population est l'ensemble complet des individus concernés par une étude statistique. Un échantillon est un sous-ensemble de cette population, sélectionné pour être étudié — souvent parce qu'il est impossible ou trop coûteux d'interroger la population entière. Un échantillon est dit représentatif lorsqu'il reflète fidèlement les caractéristiques importantes de la population dont il est tiré.
- Aléatoire simple : chaque individu a une chance égale d'être sélectionné (tirage au sort).
- Systématique : on sélectionne un individu sur n dans une liste ordonnée.
- Stratifié : la population est divisée en sous-groupes homogènes (« strates »), puis on échantillonne proportionnellement dans chaque strate.
- Par grappes : la population est divisée en groupes naturels (« grappes »), et on sélectionne quelques grappes entières.
Un directeur de centre d'éducation des adultes veut sonder la satisfaction de ses 800 élèves.
- Aléatoire simple : il tire au sort 80 noms dans la liste complète des élèves.
- Systématique : il classe les élèves par ordre alphabétique et sélectionne un élève sur dix.
- Stratifié : il divise les élèves par programme d'études et sonde 10% de chaque programme.
- Par grappes : il choisit au hasard 4 groupes-classes complets et sonde tous les élèves de ces 4 groupes.
Un échantillon mal choisi peut mener à des conclusions complètement erronées, même avec un grand nombre de répondants. Le biais de volontariat est particulièrement fréquent : un sondage affiché sur un site web, auquel seules les personnes motivées à répondre participeront, ne représente presque jamais fidèlement l'opinion de la population entière.
- Qualitatif : une catégorie non numérique (couleur préférée, statut civil).
- Quantitatif discret : une valeur numérique isolée, souvent un entier (nombre d'enfants).
- Quantitatif continu : une valeur qui peut prendre n'importe quelle valeur dans un intervalle (taille, temps, masse).
- Dresser la liste des valeurs (ou classes) que peut prendre le caractère étudié.
- Compter l'effectif (fréquence absolue) pour chaque valeur ou classe.
- Calculer la fréquence relative : \( \dfrac{\text{effectif}}{\text{effectif total}} \), souvent en %.
- Calculer, si utile, la fréquence cumulée jusqu'à une valeur donnée.
Le nombre d'enfants dans 20 familles interrogées : \(1, 2, 0, 3, 2, 2, 1, 0, 2, 1, 3, 2, 1, 0, 2, 4, 1, 2, 3, 2\)
| Nombre d'enfants (x) | 0 | 1 | 2 | 3 | 4 |
|---|---|---|---|---|---|
| Effectif | 3 | 5 | 8 | 3 | 1 |
| Fréq. relative | 15% | 25% | 40% | 15% | 5% |
| Fréq. cumulée | 3 | 8 | 16 | 19 | 20 |
On lit, par exemple, que 16 des 20 familles (soit 80%) ont au plus 2 enfants — c'est exactement ce que révèle la fréquence cumulée.
Un histogramme représente une distribution à caractère quantitatif continu (ou discret regroupé en classes), où chaque classe est un rectangle dont la hauteur correspond à l'effectif et la largeur à l'étendue de la classe. Les rectangles sont collés les uns aux autres, pour montrer la continuité de la variable.
Ne confonds pas un histogramme avec un diagramme à bandes! Le diagramme à bandes sert aux données qualitatives ou discrètes non regroupées, et ses bandes sont séparées. L'histogramme, lui, sert aux données continues, et ses rectangles sont collés.
Un échantillon bien choisi — aléatoire simple, systématique, stratifié ou par grappes — permet d'étudier une population entière sans avoir à interroger chacun de ses membres, à condition d'éviter les biais comme le biais de volontariat. Les données recueillies peuvent être organisées en tableau de fréquences, puis visualisées à l'aide d'un histogramme lorsque le caractère étudié est continu. La section suivante utilisera ces tableaux pour calculer des mesures qui résument une distribution entière en un seul nombre : le mode, la médiane et la moyenne.