Aller au contenu
DataLittéracie

Module 05

Analyser & prédire

Une moyenne peut mentir, deux courbes qui montent ensemble ne prouvent rien, et une prévision sans marge d’erreur n’est qu’une devinette déguisée. Les bases de l’analyse et de la prédiction, sans formule obligatoire.

  • Environ 18 min
  • À voir avant : module 2, module 4
  • Mis à jour le

La situation

Chez Cap Sportif…Le bureau doit décider combien de créneaux ouvrir à la rentrée. Le trésorier trace une droite sur le graphique de fréquentation et annonce : « Ça baisse, on réduit les créneaux. » A-t-il raison ?

L’analogie

Palier 1 : En bref · j’ai 2 minutes

Analyser, c’est résumer des données sans les trahir et chercher des liens sans confondre corrélation et causalité ; prédire, c’est prolonger ce qu’on a observé avec un modèle, qui reste une carte simplifiée du réel, toujours accompagnée de sa marge d’incertitude.

Palier 2 : Je veux comprendre

Résumer, relier, prolonger : les trois gestes de l’analyse

Résumer sans trahir

Pour décrire un ensemble de valeurs d’un seul chiffre, on a deux grands outils :

  • la Moyenne : La somme des valeurs divisée par leur nombre. Très sensible aux valeurs extrêmes.Image : Le partage équitable du gâteau entre tous les invités. Voir dans le glossaire : on additionne tout et on partage équitablement. Elle est très sensible aux valeurs extrêmes ;
  • la Médiane : La valeur du milieu quand on range les valeurs dans l’ordre : la moitié est en dessous, la moitié au-dessus. Peu sensible aux extrêmes.Image : La personne au milieu de la file quand tout le monde se range par taille. Voir dans le glossaire : la valeur du milieu quand on range tout dans l’ordre. Une valeur extrême ne la fait presque pas bouger.

Neuf adhérents donnent entre 10 et 60 € à une collecte, un mécène donne 5 000 € : le « don moyen » dépasse 500 €, alors que la médiane reste à 22,50 €. Aucun donateur réel ne ressemble à la moyenne. C’est le même phénomène qui rend la moyenne des salaires trompeuse : quelques très hauts revenus la tirent vers le haut, la médiane dit mieux ce que gagne une personne « typique ».

Un chiffre seul ne suffit jamais : il faut aussi la Dispersion : À quel point les valeurs s’écartent les unes des autres (étendue, écart-type…). Deux groupes peuvent avoir la même moyenne et une dispersion très différente.Image : Deux classes avec la même moyenne à un contrôle : dans l’une, tout le monde tourne autour de 12 ; dans l’autre, des 20 et des 4 se côtoient. Voir dans le glossaire, c’est-à-dire à quel point les valeurs s’écartent les unes des autres. Deux sections peuvent avoir le même âge moyen, 30 ans : l’une avec des adhérents de 28 à 32 ans, l’autre avec des enfants et des retraités.

Relier sans se tromper de cause

Deux grandeurs corrélées varient ensemble. C’est une information intéressante… qui ne dit pas pourquoi. Face à une Corrélation : Deux grandeurs qui varient ensemble. Cela ne dit pas laquelle cause l’autre, ni même s’il y a un lien de cause.Image : Les ventes de parapluies et les ventes de bottes montent ensemble certains jours : les deux suivent la pluie, sans que l’une cause l’autre. Voir dans le glossaire, quatre explications sont toujours possibles :

  1. A cause B ;
  2. B cause A (la causalité inverse) ;
  3. un troisième facteur fait varier les deux : c’est la Variable cachée (facteur de confusion) : Un troisième facteur qui influence deux grandeurs à la fois et crée une corrélation trompeuse entre elles.Image : La chaleur de l’été fait vendre des glaces et augmente les baignades : les glaces ne causent pas les noyades. Voir dans le glossaire ;
  4. c’est une coïncidence, surtout quand on a peu de données.

Le grand classique : dans certaines régions, les communes qui comptent le plus de nids de cigognes comptent aussi le plus de naissances. Les cigognes n’apportent pas les bébés : les communes rurales ont à la fois plus de cigognes et, souvent, plus de familles avec enfants. Pour établir une Causalité : Un lien où la variation de l’une produit la variation de l’autre. Il se démontre par des expériences ou des raisonnements rigoureux, pas par un simple graphique.Image : Actionner l’interrupteur et voir la lumière s’allumer : là, un geste précis produit vraiment l’effet, ce qu’un simple graphique ne suffit jamais à prouver. Voir dans le glossaire, il faut beaucoup plus qu’un graphique : une expérience (comparer deux groupes tirés au sort), ou un raisonnement rigoureux qui écarte les autres explications.

Prolonger une tendance

Une Tendance : La direction générale d’une série dans le temps, une fois qu’on met de côté les variations de court terme.Image : La courbe de la marée, une fois qu’on ignore chaque vague : elle monte ou elle descend, malgré les creux et les bosses du moment. Voir dans le glossaire est la direction générale d’une série, une fois qu’on met de côté les variations de court terme. La tentation est grande de la prolonger à la règle : c’est l’Extrapolation : Prolonger une tendance au-delà des données observées. Plus on s’éloigne, plus l’incertitude grandit.Image : Deviner la suite de la route dans le brouillard. Voir dans le glossaire. Elle a deux limites :

  • elle ne voit que ce qu’on lui montre : une droite ignore les saisons, les vacances, la rentrée. Tracée sur une série qui se termine par l’été, elle « voit » une baisse là où une rentrée se prépare ;
  • l’incertitude grandit avec la distance : prévoir le mois prochain est déjà incertain, prévoir dans cinq ans relève souvent de la divination.

Un modèle est une carte, pas le territoire

Un Modèle : Une représentation simplifiée du réel, construite à partir de données, qui sert à décrire ou à prévoir. Jamais le réel lui-même.Image : Une carte : utile précisément parce qu’elle simplifie le territoire. Voir dans le glossaire est une représentation simplifiée du réel, construite à partir de données, qui sert à décrire ou à prévoir. Comme une carte, il est utile parce qu’il simplifie, et dangereux quand on l’oublie. Une prévision honnête est donc toujours accompagnée d’une Incertitude : La marge d’erreur autour d’une estimation ou d’une prévision. Une prévision honnête l’affiche.Image : La météo qui annonce « 70 % de pluie » plutôt que « il pleuvra » : elle dit sa marge d’erreur au lieu de jouer les certitudes. Voir dans le glossaire : « entre 420 et 780 présences » dit plus de vérité que « 600 présences ».

Le piège du surapprentissage

Plus un modèle est souple, mieux il colle aux données passées. Mais au-delà d’un certain point, il apprend aussi le bruit, les hasards, les exceptions : c’est le Surapprentissage (overfitting) : Un modèle qui colle parfaitement aux données passées, bruit compris, et prévoit mal les nouvelles situations.Image : L’élève qui apprend le corrigé par cœur et échoue dès que la question change. Voir dans le glossaire. Il devient parfait sur le passé et absurde sur l’avenir, comme l’élève qui a appris le corrigé par cœur et échoue dès que l’énoncé change. Le remède : juger un modèle sur des données qu’il n’a pas vues pendant son apprentissage.

Du tableau de bord à l’intelligence artificielle

Un modèle d’Apprentissage automatique (machine learning) : Des méthodes où un programme ajuste lui-même un modèle à partir d’exemples, au lieu de suivre des règles écrites à la main.Image : Apprendre à reconnaître les chiens en regardant des milliers de photos étiquetées, plutôt qu’en récitant une liste de règles sur les oreilles et la queue. Voir dans le glossaire (machine learning) n’est pas d’une autre nature : il ajuste lui-même un modèle très souple à partir de milliers d’exemples. Les mêmes questions s’appliquent donc, en plus grand : les données d’apprentissage sont-elles fiables et représentatives ? Le modèle a-t-il été testé sur des cas nouveaux ? Quelle est sa marge d’erreur ? Et que se passe-t-il quand le monde change ?

À toi de manipuler

Trois laboratoires : prévoir la rentrée, démasquer de fausses causes, et voir un seul don faire exploser une moyenne.

Démonstration interactive

Le labo à prédictions

Place ton estimation pour septembre 2026, révèle les prévisions, puis ajoute un événement exceptionnel et fais varier la complexité du modèle.

Présences aux entraînements, par mois

02505007501 000septoctnovdécjanvfévrmarsavrmaijuinjuilaoûtseptoctnovdécjanvfévrmarsavrmaijuinjuilaoût?saison 2024-2025saison 2025-2026
  • Présences observées
  • Ton estimation

Regarde la forme des deux saisons, puis place ton estimation. Pas de calcul : juste ton intuition.

Démonstration interactive à retrouver en ligne : https://hylst.fr/datalitteracie/modules/analyser-predire/#demo

Démonstration interactive

Vraie corrélation ou fausse causalité ?

Quatre liens bien réels. À chaque fois, choisis l’explication la plus solide avant de la révéler.

Chaque point est un mois de l’année : les ventes de glaces de la commune, et le nombre de noyades dans la région.

510152050100150Glaces vendues (milliers) →Noyades →

Corrélation : r = 0,98 (lien fort)

Qu’est-ce qui explique le mieux ce lien ?

Démonstration interactive à retrouver en ligne : https://hylst.fr/datalitteracie/modules/analyser-predire/#demo

Démonstration interactive

Moyenne ou médiane ?

Fais varier le don du mécène et regarde qui bouge.

Pour financer un minibus, Cap Sportif lance une collecte. Neuf adhérents donnent entre 10 et 60 €. Puis un mécène se manifeste…

0 €50 €100 €
Moyenne
28,5 €
Médiane
22,5 €
Étendue (max − min)
50 €

Tant que le mécène reste dans la norme, moyenne et médiane se ressemblent : toutes deux décrivent bien un « don typique ».

Démonstration interactive à retrouver en ligne : https://hylst.fr/datalitteracie/modules/analyser-predire/#demo

Palier 3 : Je veux creuser

Les formules, les tests, la validation et quelques pièges statistiques

Les formules, enfin

Rien de ce qui suit n’est nécessaire pour avoir compris le module. C’est la version « mécanique » de ce que tu viens de manipuler.

  • Moyenne : on additionne les n valeurs et on divise par n : x̄ = (x₁ + x₂ + … + xₙ) ÷ n.
  • Médiane : on range les valeurs ; si n est impair, c’est celle du milieu ; s’il est pair, la moyenne des deux du milieu.
  • Écart-type : la racine carrée de la moyenne des carrés des écarts à la moyenne (avec n − 1 au dénominateur pour un échantillon). Il se lit dans l’unité des données : « en moyenne, on s’écarte d’environ tant de la moyenne ».
  • Coefficient de corrélation de Pearson (r) : entre −1 et +1. Proche de +1, les deux grandeurs montent ensemble le long d’une droite ; proche de 0, pas de lien linéaire (il peut exister un lien courbe !) ; proche de −1, l’une monte quand l’autre descend.
  • Droite de régression : y = a + b·x, où a et b minimisent la somme des carrés des écarts entre les points et la droite (méthode des moindres carrés). La pente b se calcule comme la covariance de x et y divisée par la variance de x.
  • Intervalle de prévision : autour de la droite, sa demi-largeur à 95 % vaut environ 1,96 × s × √(1 + 1/n + (x₀ − x̄)² ÷ Σ(xᵢ − x̄)²), où s est l’écart-type des résidus. Le dernier terme explique pourquoi la zone s’élargit à mesure qu’on s’éloigne du centre des données.

Juger un modèle sur ce qu’il n’a pas vu

Pour éviter le surapprentissage, on sépare les données en deux : un jeu d’apprentissage pour ajuster le modèle, un jeu de test qu’il ne voit jamais pendant l’ajustement. Pour des séries temporelles, le test doit se faire sur la période la plus récente (on ne prévoit pas le passé avec le futur). La validation croisée répète l’opération sur plusieurs découpages. Ce compromis porte un nom : l’arbitrage biais-variance ; trop simple, le modèle rate la structure (biais) ; trop souple, il épouse le bruit (variance).

Des modèles qui connaissent les saisons

Pour des données saisonnières comme la fréquentation d’un club, des méthodes classiques intègrent explicitement la saison : le « naïf saisonnier » (même mois l’an dernier), le lissage exponentiel de Holt-Winters, les modèles ARIMA saisonniers. Deux saisons d’historique, c’est peu : avec si peu de recul, il est difficile de distinguer une vraie tendance d’une fluctuation.

Quelques pièges qui piègent même les pros

  • Le paradoxe de Simpson : une tendance présente dans chaque sous-groupe peut s’inverser quand on regroupe tout. Une section peut progresser chez les jeunes et chez les adultes… et reculer au total, si la part des jeunes, moins nombreux à s’inscrire, a augmenté.
  • Les comparaisons multiples : teste vingt corrélations au hasard, et l’une d’elles paraîtra « significative » au seuil de 5 %, par simple chance. Chercher jusqu’à trouver quelque chose, c’est fabriquer une découverte.
  • Le biais de survie : n’analyser que les adhérents restés au club, c’est ignorer pourquoi les autres sont partis.
  • La régression vers la moyenne : après une saison exceptionnelle, la suivante est souvent moins bonne, sans qu’aucune cause particulière n’intervienne.

Exercice corrigé

Retour sur le labo à prédictions : pourquoi la droite du trésorier s’est-elle trompée ?

Pourquoi la droite s’est-elle trompée ?

Le trésorier a prolongé une droite de tendance sur deux saisons de fréquentation. Elle annonçait environ 425 présences pour septembre 2026 ; il y en a eu 598. Coche toutes les raisons valables de cette erreur.

Pourquoi la droite s’est-elle trompée ?

Étude de cas

Fil rouge · Cap Sportif

L’outil qui « prédit » les départs

Un prestataire propose à Cap Sportif un logiciel qui « prédit quels adhérents risquent de se désinscrire l’an prochain », avec un score de risque pour chacun. « Notre intelligence artificielle est fiable à 90 % », promet la plaquette.

Que signifie vraiment « 80 % de risque de départ » pour un adhérent ?

Pas qu’il partira. Plutôt que, parmi des adhérents qui lui ressemblaient dans les données d’apprentissage, environ 8 sur 10 sont partis. C’est une probabilité sur un groupe, pas un verdict sur une personne. Et « fiable à 90 % » ne veut rien dire tant qu’on ne sait pas comment cela a été mesuré : si 90 % des adhérents restent chaque année, un outil qui répond « il restera » à tout le monde est… fiable à 90 %, et parfaitement inutile.

Quelles questions poser au prestataire ?
  • Sur quelles données le modèle a-t-il appris ? Celles d’autres clubs ? Sont-elles comparables à un petit club de quartier ?
  • A-t-il été testé sur des données qu’il n’avait pas vues ? Avec quel taux d’erreur, dans les deux sens (partants non détectés, fidèles signalés à tort) ?
  • Quelles données faut-il lui fournir ? Fréquence de venue, paiements, âge… Est-ce proportionné à la finalité (module 1) ? Où seront-elles envoyées et hébergées (modules 8 et 9) ?
  • Que fera-t-on du score ? Un appel amical aux adhérents qu’on n’a pas vus depuis longtemps ne nécessite pas d’algorithme. Un tarif différent selon le « risque » poserait de sérieux problèmes d’équité (module 10).
Et la solution la plus simple ?

Regarder soi-même qui n’est pas venu depuis un mois, et prendre des nouvelles. Souvent, un bon tableau de bord et un peu d’attention humaine valent mieux qu’un modèle opaque.

Pour aller plus loin

  • Seeing Theory (en anglais)Université Brown

    Des visualisations interactives superbes pour comprendre probabilités et statistiques en manipulant.

  • Statistiques et probabilitésKhan Academy (gratuit)

    Des cours et exercices progressifs, en français, de la moyenne à la régression.

  • Spurious correlations (en anglais)Tyler Vigen

    Une collection hilarante de corrélations absurdes (mais bien réelles) pour ne plus jamais confondre lien et cause.

Mini-quiz

Quelques questions pour vérifier l’essentiel et débloquer le badge du module. Aucune note, aucune limite d’essais.

Question 1 sur 5
Dans une entreprise, neuf salariés gagnent entre 1 800 et 2 500 € par mois et la dirigeante 40 000 €. Quel indicateur décrit le mieux le salaire d’une personne « typique » ?