Validité externe
La validité du test est évaluée par rapport à deux critères externes : l'appréciation globale de l'enseignant, et le test de dépistage de 3ème maternelle (Inizan ou test expérimental selon le groupe d'enfants).
1. « Total MathEval » versus appréciation de l'enseignant
Analyse de la variance (ANOVA)
Les moyennes des enfants considérés comme très faibles, moyens ou très forts par l'enseignant sont bien distinctes au test MathEval :
| Groupe (enseignant) | N | Moyenne MathEval | Écart-type | Médiane | IC 95% de la moyenne |
|---|---|---|---|---|---|
| Faible | 10 | 67,2 | 17,26 | 62 | [54,9 ; 79,5] |
| Moyen | 42 | 87,98 | 16,10 | 88,5 | [83,0 ; 93,0] |
| Très fort | 13 | 115,08 | 27,49 | 105 | [98,5 ; 131,7] |
| Ensemble | 65 | 90,2 | 23,69 | 90 |
Intervalle de confiance à 95% de la moyenne (loi de Student, moyenne ± t(seuil, ddl)×écart-type/√n) ajout 2026 — malgré des groupes extrêmes de petite taille, les trois intervalles ne se chevauchent pas (79,5 < 83,0 et 93,0 < 98,5) : la séparation entre groupes n'est pas un artefact de petit échantillon.
| Source | DF | SS | MS | F |
|---|---|---|---|---|
| Classt (groupe enseignant) | 2 | 13542,9 | 6771,45 | 18,76 |
| Erreur | 62 | 22381,5 | 360,99 | |
| Total | 64 | 35924,4 |
p = 4,3 × 10⁻⁷ — très hautement significatif.
Test non paramétrique de Kruskal-Wallis
Test utilisé par les auteurs du Tedi-Math, comparant les médianes plutôt que les moyennes. Ici aussi, les médianes des trois groupes diffèrent de manière extrêmement significative.
Indice de Kappa
Contrairement à l'ANOVA et au Kruskal-Wallis, l'indice de Kappa mesure l'accord entre l'estimation de l'enseignant et le résultat MathEval pour chaque élève en particulier — il donne une estimation plus intuitive de la significativité psychologique (par opposition à statistique) du phénomène.
Sur les 65 enfants testés, 23 (soit 35%) sont classés différemment selon leur note totale au test MathEval et l'appréciation de l'enseignant. Indice de Kappa = ,41 — à la limite entre un accord faible et modéré. Confirmation que la significativité statistique n'est pas synonyme de significativité psychologique : il faut rester prudent dans l'interprétation des indices statistiques.
| Kappa | Interprétation |
|---|---|
| < 0 | Désaccord |
| 0,00 – 0,20 | Accord très faible |
| 0,21 – 0,40 | Accord faible |
| 0,41 – 0,60 | Accord modéré |
| 0,61 – 0,80 | Accord fort |
| 0,81 – 1,00 | Accord presque parfait |
L'enseignant est-il plus proche de MathEval, ou des autres tests de dépistage ?
Un Kappa de ,41 entre MathEval et l'enseignant pourrait laisser penser que MathEval s'accorde imparfaitement avec un critère de référence. Mais l'enseignant n'est pas davantage un instrument validé : rien ne dit a priori que son jugement est plus proche de la réalité que celui de MathEval. Le même calcul de Kappa (groupes reconstitués dans les mêmes proportions que celles de l'enseignant) appliqué aux deux tests de dépistage indépendants donne :
| Comparaison avec l'enseignant | N | Accord | Kappa |
|---|---|---|---|
| « Total MathEval » | 65 | 65% | ,41 |
| Test Jod — sous-test Nombres | 48 | 47,9% | ,03 |
| Test Jod — total | 48 | 66,7% | ,38 |
| Test d'Inizan | 15 | 86,7% | ,68(*) |
(*) à interpréter avec une extrême prudence : sur ces 15 enfants, un seul est classé « faible » par l'enseignant — un déclassement suffirait à faire fortement varier ce Kappa.
L'accord de MathEval avec l'enseignant (,41) est donc comparable ou supérieur à celui des deux tests de dépistage dédiés — à l'exception du test d'Inizan, dont l'échantillon est ici bien trop restreint pour trancher. Le sous-test « Nombres » du Jod, en particulier, ne s'accorde quasiment pas avec l'enseignant une fois converti en trois groupes (Kappa ,03), alors que sa corrélation continue avec le score total MathEval est de ,40 (voir la page Corrélations) — un rappel que le passage d'une échelle continue à trois catégories fait perdre beaucoup d'information, et qu'un Kappa isolément bas ne signifie pas nécessairement une mauvaise validité.
Intervalles de confiance des corrélations avec les critères externes ajout 2026
Les corrélations continues entre le score total MathEval et chacun des critères externes, avec leur intervalle de confiance à 95% (méthode de la transformation z de Fisher — voir Conclusions pour le principe) :
| Comparaison | r | N | IC 95% |
|---|---|---|---|
| Total MathEval vs Classt. enseignant | ,61 | 65 | [,43 ; ,74] |
| Total MathEval vs Test Inizan | ,53 | 15 | [,02 ; ,82] |
| Total MathEval vs JodTot | ,38 | 48 | [,11 ; ,60] |
| Total MathEval vs JodNb | ,40 | 48 | [,13 ; ,61] |
L'intervalle du test d'Inizan ([,02 ; ,82]) illustre numériquement sa fragilité déjà signalée pour le Kappa : avec seulement 15 enfants, la vraie corrélation pourrait être presque nulle comme très forte — impossible à trancher sur un si petit échantillon.
2. « Total MathEval » versus test de dépistage de 3ème maternelle
Les résultats totaux MathEval ont été classés en trois catégories (faible/moyen/bon) en respectant les pourcentages de l'appréciation enseignant : 11% (faible), 69% (moyen), 20% (fort), sur les 48 enfants de cette analyse.
| Test | Seuil de signifiance (p) |
|---|---|
| ANOVA | ,008 |
| Kruskal-Wallis | ,07 |
La validité externe se confirme ou non selon le test utilisé : significative à l'ANOVA (,008), non significative au seuil conventionnel de .05 au Kruskal-Wallis (,07). L'analyse par groupe montre que les moyennes et médianes des groupes moyen et fort sont assez proches — le test identifie très bien les élèves les plus faibles, mais discrimine moins bien les élèves moyens et forts. Cela ne devrait pas inquiéter outre mesure, le rôle d'un test de dépistage étant justement de repérer les enfants potentiellement en difficulté.
3. Validité externe du test expérimental de 3ème maternelle
48 élèves ont été évalués à l'aide d'un test expérimental mis au point par des collègues d'un centre PMS du Brabant wallon.
a) Validité externe globale
Les moyennes et médianes des trois groupes repérés par les enseignants (faibles/moyens/bons) le sont également au test expérimental — différences significatives à un seuil inférieur à .001, quel que soit le test utilisé.
b) Pouvoir prédictif des sous-tests spécifiques
Deux sous-tests du test expérimental ont un lien avec les mathématiques : l'un évalue le vocabulaire spatial, l'autre le concept du nombre.
| Sous-test | ANOVA (p) | Kruskal-Wallis (p) | Significatif ? |
|---|---|---|---|
| « Nombres » | ,0013 | ,037 | Oui, aux deux tests |
| « Spatial » | ,0335 | ,11 | À l'ANOVA seulement |
Le sous-test « Nombres » est donc plus prédictif du niveau en mathématique que le sous-test « Spatial », confirmant que la spécificité mathématique du contenu importe pour la valeur prédictive.
