Tableaux croisés et fréquences conditionnelles

Lire une population à deux caractères et calculer des fréquences marginales ou conditionnelles.

Télécharger le PDF
Un mot d’encouragement, si tu en as besoin

Tu peux avancer à ton rythme. Une difficulté ne définit pas ce dont tu es capable.

Trouver du soutien
Avant de commencer5 questions pour vérifier tes bases
1. Une liste est 2 ; 2 ; 4 ; 5 ; 2. Quel est l’effectif de la valeur 2 ?
2. Quel caractère est qualitatif ?
3. Un tableau compte 6 élèves avec un résultat donné, sur 30 élèves. Quelle est sa fréquence ?
4. Quels nombres appartiennent à la fois à [0 ; 4] et à [2 ; 6] ?
5. La moitié d’un groupe pratique un sport ; le tiers de ces sportifs nage. Quelle fraction du groupe nage ?

Ton parcours dans ce chapitre

Un même tableau peut répondre à plusieurs questions. Pour ne pas les confondre, on nomme d’abord le groupe étudié, puis on choisit son total de référence.

Bases à reprendre : une fréquence est un effectif divisé par celui du groupe choisi. Par exemple, \(3/12=25\,\%\). On travaille avec un effectif total \(N>0\) ; une fréquence conditionnelle demande aussi un groupe de référence non vide. Chaque pause donne accès librement à deux indices puis à l’explication.

Repères 2026–2027 : tableaux croisés, fréquences marginales et conditionnelles, filtres logiques et interprétation de données. Le fichier Iris donne une enquête réelle à explorer. Les formules générales de pondération, l’indépendance descriptive, le paradoxe de Simpson et la standardisation sont des prolongements guidés.

Pourquoi croiser deux variables ?

Une statistique à une variable répond à une question comme : « quelle proportion d'élèves arrive à l'heure ? ». Croiser deux variables permet d'aller plus loin : cette proportion est-elle la même selon le mode de transport ? Le tableau croisé sert à organiser les couples d'informations observés sur les mêmes individus.

Variables qualitatives et modalités

Nominale ou ordinale

Un individu fournit un couple

Si l'on observe deux variables \(X\) et \(Y\), chaque individu fournit un couple

\[\bigl(X(\text{individu}),Y(\text{individu})\bigr).\]

Par exemple, un élève peut fournir le couple (transports en commun, à l'heure).

Le produit cartésien rassemble les couples possibles

Construire et lire un tableau croisé

Cases intérieures et marges

Le langage des ensembles

Notons \(A\) l'ensemble des élèves utilisant un transport actif et \(H\) l'ensemble des élèves arrivés à l'heure. Alors

\[\operatorname{Card}(A)=50,\qquad \operatorname{Card}(H)=124,\qquad \operatorname{Card}(A\cap H)=42.\]

Fréquences globales et marginales

Fréquence d'une case

Dans l'exemple,

\[\begin{aligned}f(A\cap H) &= \frac{42}{160}\\[.35em]&= 0{,}2625\\[.35em]&= \boxed{26{,}25\,\%}.\end{aligned}\]

Cela signifie que 26,25 % de tous les élèves sont à la fois utilisateurs d'un transport actif et ponctuels.

Fréquence marginale

Ainsi,

\[\begin{aligned}f(A) &= \frac{50}{160}\\[.35em]&= 31{,}25\,\%,\\[.35em]f(H) &= \frac{124}{160}\\[.35em]&= 77{,}5\,\%.\end{aligned}\]

Fréquences conditionnelles

Le dénominateur est le groupe après « parmi »

L'ordre change la question

Tableaux de fréquences conditionnelles

Si l'on conditionne par le mode de transport, chaque colonne devient un groupe de référence et totalise 100 %.

ActifTransportsMotorisé
À l'heure\(42/50=84\,\%\)\(58/70\approx82{,}9\,\%\)\(24/40=60\,\%\)
En retard\(8/50=16\,\%\)\(12/70\approx17{,}1\,\%\)\(16/40=40\,\%\)
Total100 %100 %100 %

Attention aux arrondis : des parts affichées à un chiffre après la virgule peuvent totaliser \(99{,}9\,\%\) ou \(100{,}1\,\%\). Vérifie les effectifs ou les fractions exactes avant de conclure à une erreur.

Reconstruire une fréquence globale

Compléter un tableau croisé

À partir des marges

À partir d'une fréquence conditionnelle

Représenter et comparer les groupes

Barres empilées à 100 %

Pour comparer des groupes de tailles différentes, on représente leurs fréquences conditionnelles sur des barres de même longueur.

Schéma : Barres empilées à 100 %

Manipuler les proportions d’un groupe

La manipulation suivante représente \(100\) objets fictifs : \(10\) dans \(A\), dont \(8\) marqués \(B\), et \(90\) hors \(A\), dont \(18\) marqués \(B\). On peut vérifier les comptes sur papier : \(8/10=80\,\%\) parmi \(A\), contre \(8/26\approx30{,}77\,\%\) de \(A\) parmi \(B\).

Changer de groupe pour comprendre « sachant que »

Sur 100 objets, 10 sont dans le groupe A. Parmi A, 80 % portent la marque B ; parmi les autres, 20 % portent B. Prévois combien des objets portant B appartiennent à A.

Le rectangle représente exactement 100 objets. À gauche : le groupe A. Les zones bleues portent B ; les zones claires ne portent pas B. Les surfaces sont proportionnelles aux effectifs.

Parmi A, 8 objets sur 10 portent B. Hors A, 18 sur 90 portent B. Parmi les 26 objets portant B, 8 appartiennent donc à A : 8/26 ≈ 30,77 %, tandis que 8/10 = 80 %.

Lire les valeurs et les coordonnées

Parmi A, 8 objets sur 10 portent B. Hors A, 18 sur 90 portent B. Parmi les 26 objets portant B, 8 appartiennent donc à A : 8/26 ≈ 30,77 %, tandis que 8/10 = 80 %.

Garde les deux parts de B fixes et augmente la taille de A. Explique pourquoi la part de A parmi les objets portant B change. Pour calculer une probabilité conditionnelle, quel groupe devient ton total de référence ?

Dans cette expérience, un objet est choisi uniformément : les fréquences du tableau sont aussi les probabilités affichées. Le rectangle entier représente \(100\) objets, tandis qu’une barre normalisée à \(100\,\%\) représente son propre groupe.

Choisir la bonne représentation

Comparer et interpréter sans se tromper

Écart en points de pourcentage

Dans l'exemple, l'écart de ponctualité entre les transports actifs et motorisés vaut

\[84\,\%-60\,\%=\boxed{24\ \text{points de pourcentage}}.\]

Dire « 24 % de plus » serait ambigu : un écart de proportions se formule de préférence en points.

Association et causalité

Filtrer des données avec la logique et Python

ET, OU, NON

Explorer un fichier réel : les iris

Le jeu Iris, version UCI, contient \(150\) observations et trois espèces de \(50\) observations chacune. On croise l’espèce avec une catégorie construite à partir de la longueur du pétale : « moins de \(4{,}5\) cm » ou « \(4{,}5\) cm et plus ». La mesure est quantitative ; sa classe devient une catégorie ordonnée.

Espèce\(<4{,}5\) cm\(\geqslant4{,}5\) cmTotal
setosa50050
versicolor292150
virginica05050
Total7971150

Refaire le comptage : télécharge le fichier CSV des 150 observations. Dans ton tableur, ouvre-le avec le séparateur point-virgule ; chaque ligne est un individu. Filtre l’espèce, puis la classe de longueur, et compte les lignes restantes. Compare les six comptes au tableau, puis change le seuil à \(5\) cm. Garde ensemble les cellules d’une même ligne lorsque tu tries.

Source : R. Fisher, Iris (1936), UCI Machine Learning Repository, DOI 10.24432/C56C76, licence CC BY 4.0. Le fichier pédagogique sélectionne deux colonnes, ajoute une catégorie et conserve les 150 observations de iris.data. Les précisions de source et d’adaptation sont fournies avec le CSV.

Ces proportions décrivent ce fichier équilibré entre espèces, pas la répartition des iris dans la nature. Les zéros du tableau ne prouvent pas une impossibilité biologique ; le seuil est notre choix de classement.

Construire le tableau à partir de listes

transports = ["actif", "commun", "actif", "motorise"]
ponctuels = [True, True, False, False]

effectif = 0
if len(transports) != len(ponctuels):
    raise ValueError("listes de memes longueurs attendues")

for t, h in zip(transports, ponctuels):
    if t == "actif" and h:
        effectif = effectif + 1

print(effectif)

zip associe les valeurs de même rang. Si les deux listes ont des longueurs différentes, il s’arrête à la plus courte : le contrôle précédent évite de perdre silencieusement des individus. La syntaxe est fournie pour lire le filtrage ; le tableur permet de faire la même exploration sans programmer.

Du tableau statistique au modèle probabiliste

Avec \(A=\) « transport actif » et \(H=\) « à l'heure »,

\[P(A)=\frac{50}{160},\qquad P(A\cap H)=\frac{42}{160},\qquad P_A(H)=\frac{42}{50}.\]

La même fraction apparaît, mais son statut change : dans l'enquête, elle décrit une fréquence observée ; dans le modèle, elle devient une probabilité.

Pour aller plus loin - Accessible à tous

Indépendance observée

Le test du produit en croix pour un tableau \(2\times2\)

Considérons le tableau

\[\begin{array}{c|cc} & B & \overline B\\ \hline A & a & b\\ \overline A & c & d \end{array}.\]

Le paradoxe de Simpson

Standardiser pour comparer avec les mêmes poids

Si l'on donne artificiellement le même poids \(1/2\) aux deux niveaux, les taux standardisés deviennent

\[\text{tutorat}:\ \frac12\times90\,\%+\frac12\times60\,\%=75\,\%,\]
\[\text{sans tutorat}:\ \frac12\times80\,\%+\frac12\times50\,\%=65\,\%.\]

Cette comparaison descriptive neutralise la différence de composition. Elle ne prouve toujours pas une causalité, mais elle évite une partie du piège.

Boîte à outils et erreurs à éviter

Fiche-mémoire

Schéma : Fiche-mémoire