Analyses statistiques / 2010
Analyses statistiques 2010
Les analyses qui suivent portent sur un échantillon de 41 enfants (données complètes pour 39 d'entre eux), et ont pour but d'évaluer les aspects prédictifs du test ainsi que sa validité externe. Trois groupes d'enfants sont constitués, sur base des connaissances mathématiques acquises en fin de 1P — incluant les résultats au sous-test « opérations » de MathEval (fin de 1P), au test CMC (calcul mental collectif) et au transcodage. C'est la moyenne pondérée de ces trois épreuves qui détermine le niveau de connaissances de fin de 1P (le calcul mental pèse pour environ 3/4, le transcodage pour 1/4) :
- Niveau 1 : élèves sous le percentile 16 ;
- Niveau 2 : élèves entre le P16 et le P84 ;
- Niveau 3 : élèves au-dessus du P84.
Aspect prédictif du test MathEval
Le test de Jonckheere a été utilisé pour analyser la valeur prédictive de chaque épreuve quant au niveau (faible, moyen, fort) des connaissances mathématiques acquises en fin de 1P. On considère qu'un sous-test prédit correctement les résultats en mathématique en 1P lorsque le seuil de signifiance est inférieur à .05 (soit moins de 5 chances sur 100 de se tromper).
Exemple d'interprétation : pour « Inizan versus Niveau de connaissances », le résultat indique p = 0,032 — il n'y a qu'un peu plus de 3 chances sur 100 pour que cette prédiction soit incorrecte.
| Épreuve | Signifiance (p) |
|---|---|
| Inizan (3M) | ,032 |
| Gnosies (3M) | ,317 |
| Comptine (3M) | ,125 |
| Dénombrement (3M) | ,550 |
| Subitizing (3M) | ,107 |
| Additions (3M) | ,000 |
| Soustractions (3M) | ,093 |
| Appréciation enseignant(*) | ,077 |
| Comptine (1P) | ,006 |
| Dénombrement (1P) | ,251 |
| Subitizing (1P) | ,045 |
| Représentation des quantités (1P) | ,004 |
| Additions (1P) | ,000 |
| Soustractions (1P) | ,005 |
| CMC additions | ,000 |
| CMC soustractions | ,000 |
| Lecture de nombres | ,010 |
| Écriture de nombres | ,001 |
| Total MathEval (3M) | ,012 |
| Total Opérations (3M) | ,001 |
| Total MathEval (1P) | ,001 |
| Total Maths (1P) | ,000 |
| Total Opérations MathEval (1P) | ,000 |
| Total CMC (1P) | ,000 |
| Total Transcodage | ,000 |
| Total connaissances (1P) | ,000 |
(*) Trois groupes d'enfants ont été constitués, à la demande de l'auteur, par les enseignants : 10% les plus faibles, 80% de niveau moyen, 10% les meilleurs — sans consigne de pourcentage précise, ces proportions se sont dégagées après coup.
Ce tableau résiste-t-il à une correction pour comparaisons multiples ? ajout 2026
Ce tableau teste 26 variables au seuil conventionnel de p<.05. Or ce seuil est une garantie par test : la probabilité qu'au moins une des 26 variables franchisse ,05 par le seul fait du hasard d'échantillonnage — même si aucune n'avait de vrai effet — se monte à 1-(0,95)²⁶ ≈ 74%. Deux corrections permettent d'estimer plus fiablement ce qui reste réellement significatif :
- Bonferroni (la plus stricte) : seuil individuel ramené à ,05⁄26 = ,00192 ;
- Benjamini-Hochberg / FDR (plus souple, contrôle la proportion de faux positifs plutôt que leur simple présence) : seuil croissant selon le rang de chaque p-valeur classée.
Résultat : sur les 19 variables significatives à p<.05 brut, 12 restent significatives après Bonferroni (toutes à p≤,001 — essentiellement les scores globaux/totaux et les scores CMC), et 18 restent significatives après Benjamini-Hochberg (seule Subitizing (1P), à ,045, ne passe plus). Sous Bonferroni, 7 résultats perdent leur significativité : Inizan (3M), Comptine (1P), Subitizing (1P), Représentation des quantités (1P), Soustractions (1P), Lecture de nombres, et — plus notable — Total MathEval (3M) lui-même (p=,012).
Détail complet, avec l'explication du principe de correction, sur la page Différences filles/garçons (2011) et dans la synthèse en Conclusions.
Analyse succincte des résultats
Toutes choses égales par ailleurs, un sous-test est d'autant plus prédictif que le temps écoulé entre sa mesure et celle de la capacité que l'on cherche à prédire est court. Certains sous-tests sont non prédictifs en 3M mais le deviennent en 1P — seul le sous-test Additions passé en 3M est prédictif, alors que tous les sous-tests le sont lorsqu'ils sont administrés en 1P.
Un point subtil : la corrélation entre la « comptine 3M » et les « connaissances mathématiques en 1P » est très significative sur l'ensemble de l'échantillon (.448**), alors que ce même sous-test est jugé non prédictif selon le test de Jonckheere. La contradiction n'est qu'apparente — les corrélations partielles par groupe sont respectivement -.447 (groupe faible), .544** (groupe moyen) et -.243 (groupe fort). Le groupe moyen étant bien plus grand (70%) que les groupes faible et fort (15% chacun), la corrélation globale dilue ces corrélations marginales contradictoires.
Dans la mesure où l'objectif premier d'un test de dépistage consiste à comprendre les dysfonctionnements cognitifs des enfants en difficulté — c'est-à-dire les liens qu'entretiennent entre eux les différents prérequis évalués — le test de Jonckheere paraît plus pertinent que les chiffres globaux de corrélation, malgré le fait que cette analyse soit ici « défavorable ».
Le test d'Inizan, qui n'intègre aucun exercice mettant en jeu le nombre, la numération ou le calcul, est un bon prédicteur du niveau qui sera atteint un an plus tard en mathématique. Les résultats obtenus en 3M au test MathEval dans son ensemble sont très prédictifs du niveau mathématique en 1P — c'est également le cas pour le sous-test « opérations » passé en 3M.
Validité externe du test MathEval
Au seuil de .05, l'avis de l'enseignant ne détermine qu'imparfaitement le niveau mathématique en 1P tel que calculé par les épreuves — et réciproquement. Il y a néanmoins un peu plus de 92 chances sur 100 pour qu'il y ait concordance entre les deux estimations. La corrélation entre ces deux mesures est de .507, hautement significative : la validité externe du test peut être considérée comme très correcte.
Corrélations entre les sous-tests ajout 2026
Cette matrice de corrélations entre les 10 sous-tests administrés en 3ème maternelle (N=39, données complètes) avait été calculée à l'époque mais n'avait jamais été publiée sur le site d'origine. Chaque case indique la force du lien entre deux sous-tests, de 0 (aucun lien) à 1 (lien parfait) ; la quasi-totalité des corrélations sont positives.
| Comptine | Dénombrement | Subitizing | Représentation des quantités | Additions | Soustractions | CMC additions | CMC soustractions | Lecture de nombres | |
|---|---|---|---|---|---|---|---|---|---|
| Dénombrement | ,30 | ||||||||
| Subitizing | ,12 | ,08 | |||||||
| Représentation des quantités | ,42 | ,22 | ,00 | ||||||
| Additions | ,40 | ,09 | ,12 | ,40 | |||||
| Soustractions | ,34 | ,05 | ,26 | ,11 | ,34 | ||||
| CMC additions | ,30 | ,12 | ,37 | ,30 | ,37 | ,06 | |||
| CMC soustractions | ,43 | ,10 | ,36 | ,28 | ,20 | ,56 | ,31 | ||
| Lecture de nombres | ,32 | -,07 | ,18 | ,33 | ,11 | ,36 | ,33 | ,40 | |
| Écriture de nombres | ,46 | ,38 | ,23 | ,30 | ,31 | ,49 | ,33 | ,49 | ,37 |
Le sous-test Dénombrement se distingue nettement par des corrélations plus faibles que les autres avec le reste de la batterie. C'est exactement le même constat, indépendamment retrouvé, que celui de l'analyse 2011 (voir Consistance interne) — deux années différentes, deux groupes d'enfants différents, la même conclusion.
Analyse factorielle ajout 2026
Une analyse factorielle a également été réalisée sur ce même échantillon (N=39) mais n'avait jamais été publiée non plus. Elle confirme qu'un facteur commun domine nettement l'ensemble des sous-tests : il explique à lui seul 28,7% de la variance totale, le facteur suivant ne représentant plus que 6,3%. C'est un argument statistique supplémentaire en faveur de l'existence d'une compétence mathématique générale sous-jacente, mesurée en bonne partie par l'ensemble des sous-tests de MathEval.
| Sous-test | Saturation sur le facteur |
|---|---|
| Traitement des soustractions | ,77 |
| Écriture de nombres | ,68 |
| Lecture de nombres | ,63 |
| Soustractions | ,60 |
| Comptine | ,59 |
| Additions | ,45 |
| Traitement des additions | ,43 |
| Représentation des quantités | ,37 |
| Subitizing | ,32 |
| Dénombrement | ,29 |
Saturation : plus la valeur est proche de 1, plus le sous-test est représentatif du facteur commun. Analyse réalisée avec WinSTAT (2010).
À noter : le même fichier indique aussi un indice de cohérence interne (alpha de Cronbach) de ,27 pour cet ensemble de 10 scores bruts — nettement plus faible que les indices obtenus en 2011 (,71 à ,87, voir Consistance interne). L'explication la plus probable est que cet alpha-ci a été calculé sur des scores bruts hétérogènes (échelles de mesure très différentes d'un sous-test à l'autre), plutôt que sur des scores standardisés comme en 2011 — mais le point mériterait d'être vérifié plus précisément avant d'être considéré comme définitivement expliqué.
MathEval face au CMC, à l'Inizan et aux Gnosies ajout 2026
Le score total MathEval (1P) et le score total au test CMC (calcul mental collectif, 1P) n'avaient jamais été directement corrélés l'un à l'autre — seule leur valeur prédictive respective, prise séparément, avait été testée (voir le tableau au début de cette page). Calculé à partir des données brutes des 41 enfants :
| Comparaison | r | N |
|---|---|---|
| Total MathEval (1P) vs Total CMC (1P) | ,67 | 41 |
Une corrélation modérée à forte, cohérente avec le fait que les deux instruments évaluent des compétences numériques proches sans être identiques.
L'enseignant prédit-il mieux MathEval ou le CMC ?
Question naturelle une fois cette corrélation en main : l'appréciation globale de l'enseignant en 3ème maternelle est-elle plus proche du résultat en MathEval, ou du résultat au CMC, mesurés un an plus tard ?
| Comparaison | r | N | IC 95% |
|---|---|---|---|
| Appréciation (3M) vs Total MathEval (1P) | ,49 | 41 | [,22 ; ,70] |
| Appréciation (3M) vs Total CMC (1P) | ,48 | 41 | [,20 ; ,69] |
Intervalles de confiance à 95% par transformation z de Fisher (voir la page Conclusions pour le principe).
Aucune différence. Les deux corrélations sont quasi identiques et leurs intervalles de confiance se recouvrent presque entièrement — l'enseignant prédit MathEval et le CMC de façon statistiquement indiscernable. Ni l'un ni l'autre des deux instruments ne peut prétendre mieux « coller » au jugement de l'enseignant que l'autre.
Inizan et Gnosies : deux profils très différents
Deux autres épreuves de dépistage passées en 3M — le test d'Inizan (aucun contenu mathématique) et le sous-test Gnosies digitales — permettent une comparaison supplémentaire, avec l'appréciation de l'enseignant d'une part, et le score MathEval (1P) d'autre part :
| Comparaison | r |
|---|---|
| Inizan (3M) vs Appréciation enseignant (3M) | ,28 |
| Gnosies (3M) vs Appréciation enseignant (3M) | ,02 |
| Inizan (3M) vs Total MathEval (1P) | ,41 |
| Gnosies (3M) vs Total MathEval (1P) | ,44 |
Le contraste est net pour la comparaison avec l'enseignant : Inizan y montre un lien modeste mais réel (,28), tandis que Gnosies n'en montre quasiment aucun (,02) — cohérent avec le scepticisme déjà exprimé ailleurs sur ce site à propos de la valeur prédictive des gnosies digitales (voir Gnosies digitales). Plus surprenant : Gnosies prédit presque aussi bien que Inizan le score MathEval un an plus tard (,44 contre ,41), malgré ces réserves. Ce résultat isolé ne suffit pas à réhabiliter les gnosies digitales — il illustre surtout qu'une même variable peut se comporter différemment selon le critère externe auquel on la compare, une raison de plus de ne pas se fier à une seule comparaison.
Les épreuves simples restent les plus prédictives
Le sous-test Additions/Soustractions existe en deux versions : une épreuve directe de calcul, et une épreuve dite de « traitement » (TRT ADD / TRT SOUSTR), plus complexe. On pourrait s'attendre à ce que la version la plus élaborée prédise mieux le niveau futur — c'est l'inverse qui se produit :
| Sous-test | r avec Total MathEval (1P) |
|---|---|
| Additions | ,68 |
| Soustractions | ,72 |
| Traitement des additions (TRT ADD) | ,57 |
| Traitement des soustractions (TRT SOUSTR) | ,68 |
Les épreuves de calcul les plus simples et directes restent, ici, les meilleures prédictrices — pas les versions plus élaborées.
