10 min de lectureÉvaluation

Évaluer ce que l’étudiant a compris, quand une IA peut rendre le devoir

Un devoir fait à la maison ne dit plus qui l’a écrit. Interdire l’IA ou la détecter ne rend pas sa valeur à la note. Changer la façon d’évaluer, matière par matière, le peut.

Louis Cuvelier
Partager cet articleLinkedInXFacebook

Vous notez un devoir rendu. Il est construit, clair, sans faute. Il a peut-être été écrit par une IA, et rien sur la copie ne permet de le savoir.

Le 23 septembre, la RTBF  rapporte que des étudiants de la faculté Solvay, à l’Université libre de Bruxelles, ont été sanctionnés pour avoir utilisé l’IA pendant un examen. Deux récidivistes ont perdu leur session entière. Leurs enseignants les ont repérés à la lecture : ils ont vu des calculs en plusieurs étapes arriver avec leur résultat, sans aucun raisonnement écrit.

La vice-rectrice de l’ULB annonce dans la foulée une révision du règlement des études. L’enseignant pourra, « s’il y a une vraie suspicion, […] revoir l’étudiant, non pas pour refaire un autre examen, […] mais pour pouvoir questionner sur une réponse spécifique ». Devant une copie qui ne prouve plus rien, l’université revient à l’étudiant, et lui pose des questions.

La note doit dire ce que l’étudiant a compris, pas ce qu’il a rendu. L’enseignant garde la décision.

Cet article répond aux deux questions qu’un responsable pédagogique se pose à cette rentrée. Un devoir rendu prouve-t-il encore ce que l’étudiant a compris ? Et faut-il interdire l’IA, la détecter, ou changer la façon d’évaluer ?

Un devoir rendu prouve-t-il encore ce que l’étudiant a compris ?

Non, pas à lui seul. Un devoir fait hors de la salle prouve qu’un travail a été remis. Il ne dit plus qui l’a écrit, ni ce que son auteur a compris en l’écrivant.

La question ne porte pas sur l’honnêteté des étudiants. Elle porte sur ce que la copie permet de vérifier. Un étudiant qui a tout écrit seul et un étudiant qui a fait écrire son devoir peuvent rendre deux copies du même niveau. À la lecture, l’enseignant n’a aucun moyen de les distinguer.

La note change alors de sens sans que personne l’ait décidé. Elle mesure ce que l’étudiant a su obtenir, et l’école certifie des acquis qu’elle n’a pas vérifiés. C’est la question que la direction finit par poser : on certifie quoi, si l’IA rend les devoirs ?

Les étudiants doutent aussi de leurs évaluations. Selon l’enquête 2026 du Digital Education Council , menée dans 35 pays auprès de 27 284 étudiants et 18 114 enseignants, 28 % seulement des étudiants jugent que la plupart ou une bonne part de leurs évaluations reflètent le travail et le jugement attendus d’eux dans un monde où l’IA est présente.

Le devoir garde une valeur quand il cesse d’être une pièce isolée. Dans une tribune du Times Higher Education  du 30 septembre, Emma Ransome, de la Birmingham City University, propose de noter la progression d’un étudiant sur l’année, par points d’étape. Les brouillons, les versions successives, les fausses pistes deviennent des preuves qu’une IA fabrique mal. Elle nomme aussi l’obstacle : les règlements et les systèmes des établissements décident encore module par module.

Faut-il interdire l’IA ?

L’interdiction tient là où l’on peut surveiller. Partout ailleurs, elle reste une règle que personne ne peut faire respecter.

L’université de Sydney l’écrit sans détour dans son cadre d’évaluation . Il n’est déjà plus possible de restreindre ou de détecter l’usage de l’IA dans une évaluation qui n’est pas surveillée en présentiel. Une restriction impossible à faire respecter abîme la validité de l’évaluation. Sydney en tire deux familles d’épreuves : des évaluations sécurisées, en présentiel, qui vérifient les acquis, et des évaluations ouvertes, où l’étudiant apprend à travailler avec l’outil.

En France, l’État ne tranchera pas à votre place. Le 24 septembre, le ministère a répondu au Sénat  qu’il écarte une approche reposant « exclusivement sur leur contrôle ou leur interdiction ». Les enseignants « conservent la possibilité de déterminer les modalités d’évaluation les plus adaptées », dont des épreuves sur table ou à l’oral qui excluent l’IA. La règle revient donc à l’établissement et à l’enseignant.

Une règle qui n’est pas écrite ne protège personne. Le 12 février 2026, le tribunal administratif de Paris a rejeté en référé la demande de l’université Paris 1 contre un étudiant soupçonné d’avoir rédigé son mémoire avec l’IA. Selon l’analyse du cabinet Haas Avocats , l’université ne produisait « aucun élément relatif aux règles encadrant l’utilisation de l’intelligence artificielle ». Le 20 août, le tribunal administratif de Toulouse a suspendu une interdiction d’inscription de cinq ans prononcée contre une étudiante pour usage de l’IA en partiel, pour un « doute sérieux » sur la proportionnalité de la sanction (France 3 Occitanie ).

L’interdiction garde sa place comme modalité d’épreuve. HEC Paris alterne ainsi des évaluations « machine off », sur papier, qui vérifient les connaissances de base, et des évaluations « machine on », où l’étudiant cadre et résout un problème avec l’outil (Times Higher Education , 23 septembre). L’épreuve sans IA se tient en salle. Le devoir à la maison, lui, ne peut plus porter cette interdiction.

Faut-il détecter l’IA ?

Un détecteur donne un score, et un score ne prouve rien sur une copie donnée. Il peut justifier une question à l’étudiant. Il ne suffit pas à fonder une sanction.

Certains détecteurs sont pourtant précis sur leur terrain. Le 29 septembre, Next a testé Pangram  sur plus de 1 000 textes : 459 textes humains sur 460 ont été reconnus comme humains, et environ 95 % des 570 textes générés ont été repérés. Next précise lui-même la limite de son test : le corpus ne contient que des articles techniques. Rien ne dit que le même taux vaut pour une dissertation, un mémoire ou une copie de droit.

Hors de leur terrain, les détecteurs se trompent dans les deux sens. La présidente de la Fédération des étudiants francophones raconte, dans le même reportage de la RTBF , un texte « totalement écrit par Copilot » détecté « comme 100% humain ». À l’inverse, une étude de Stanford publiée dans Patterns  en 2023 a soumis à sept détecteurs 91 essais écrits en anglais par des non-anglophones : en moyenne, 61,3 % ont été classés à tort comme produits par une IA. Les essais d’élèves natifs, eux, passaient presque sans erreur.

Même une erreur faible pèse lourd à l’échelle d’une école. En 2023, l’université Vanderbilt  a désactivé le détecteur de Turnitin avec un calcul simple. L’éditeur annonçait 1 % de faux positifs, et l’université avait soumis 75 000 copies en 2022. Environ 750 étudiants auraient pu être soupçonnés à tort.

Le rapport du MIT sur l’IA dans l’enseignement , publié le 13 août, recommande de ne pas s’appuyer sur les détecteurs. Il y voit le début d’une course aux armements : les étudiants répondent à la détection avec des outils qui « humanisent » le texte et effacent les signaux que le détecteur cherche. Le même rapport décrit l’autre coût, un climat de défiance entre enseignants et étudiants.

À l’ULB, d’ailleurs, c’est l’absence de raisonnement qui a trahi les étudiants.

Changer la modalité : faire tenir le raisonnement

La seule réponse qui tienne change ce que l’évaluation observe. On ne juge plus un texte remis. On demande à l’étudiant de tenir son raisonnement devant quelqu’un qui peut relancer.

C’est ce que font les universités qui ont écrit leur règle ce mois-ci. À la Complutense de Madrid, selon El Español , l’enseignant peut exiger la défense orale d’un travail en cas de doute sur son auteur ou sur un usage indu de l’IA. Le texte d’une de ses facultés  va plus loin : cette défense peut prévaloir dans l’évaluation du travail quand les indices sont sérieux. À Alicante, des oraux se tiennent en public, devant trois enseignants, et sont filmés. Le MIT recommande des oraux, des portfolios sur le semestre et des travaux faits hors de la classe puis discutés en classe. Dans les écoles de commerce, la soutenance orale revient.

Chaque modalité vérifie quelque chose de précis, et chacune a un prix.

L’oral déclenché par un doute a une limite que l’ULB et la Complutense partagent : il arrive après le soupçon. L’étudiant interrogé sait qu’on le soupçonne, et l’échange ressemble déjà à une procédure. L’oral pour chacun n’a pas ce défaut, mais il demande un temps qu’aucune équipe n’a pour tous les étudiants, dans toutes les matières, sur tous les campus.

Une étude de NYU Stern montre qu’un agent peut conduire ces échanges à grande échelle, et ce que cela ne règle pas. Panos Ipeirotis et Konstantinos Rizakos  ont fait passer à 36 étudiants un oral mené par un agent vocal, 22 minutes en moyenne, sur leur projet puis sur un cas tiré du cours. 70 % des étudiants estiment que l’oral a testé leur compréhension réelle. 83 % l’ont trouvé plus stressant qu’un écrit. Les auteurs posent eux-mêmes la limite de leur dispositif, où trois modèles notent la transcription : l’accord entre les modèles établit la fiabilité de la note, pas sa justesse. Ils signalent aussi les barrières pour les étudiants non natifs et pour ceux qui ont un trouble de la parole.

La conversation vérifie mieux la compréhension qu’un texte remis. Elle ne dit pas seule ce que vaut la réponse. Quelqu’un qui connaît la matière doit lire l’échange et décider de la note.

Ce qu’une école doit écrire, matière par matière

Puisque la règle revient à l’établissement, elle doit exister par écrit avant l’épreuve. Paris 1 l’a appris devant le tribunal. Le MIT demande, pour chaque matière, une politique sur l’IA affichée dans le syllabus, qui dise ce qui est permis, interdit ou exigé, et pourquoi.

Pour chaque matière, quatre réponses suffisent à fonder la note.

  1. Ce que l’évaluation vérifie. Les acquis visés, écrits avant de choisir le format.
  2. La place de l’IA. Permise, interdite ou exigée, avec sa raison, reliée à ce que la matière doit apprendre.
  3. La modalité qui le vérifie. Une épreuve sur table si l’on veut ce que l’étudiant sait seul, une conversation si l’on veut son raisonnement, des points d’étape si l’on veut sa progression.
  4. Qui décide de la note. Un enseignant, nommé, qui peut expliquer sa décision.

Deux questions suivent, que cet article ne tranche pas. D’abord, ce que l’étudiant doit savoir avant qu’un outil d’IA l’interroge. Une école qui confie à un outil d’IA une part de l’évaluation des acquis entre dans le champ des règles les plus strictes de l’AI Act, et le calendrier de ces obligations est détaillé dans ce que le report de l’AI Act ne reporte pas. Ensuite, comment tenir la même exigence entre intervenants et entre campus, et réunir les notes de tous avant le jury.

Ce que fait Socrate, et ce qu’il ne fait pas

C’est le problème auquel Socrate répond. Un devoir rendu ne prouve plus ce que l’étudiant a compris, alors Socrate ajoute des évaluations en conversation. L’étudiant y tient son raisonnement question après question, et chaque réponse appelle une relance.

Aucune équipe ne mène cet échange avec chaque étudiant, dans chaque matière, sur chaque campus. Un agent IA le mène pour chacun, avec la même exigence partout. Chaque copie porte la note que l’agent propose et sa justification, compétence par compétence. Les signaux relevés pendant l’échange, un texte collé ou un onglet quitté, se lisent à part, hors de la note.

L’enseignant lit l’échange, puis valide ou ajuste la note. Aucune note n’existe avant ce choix. L’agent conduit la conversation, et la décision reste à l’enseignant.

Les évaluations classiques restent. Leurs notes se consignent dans Socrate, à côté de celles des conversations, et le module fonctionne sans agent IA. Les évaluations par conversation s’ajoutent quand l’école le décide, matière par matière, puisque Socrate se branche sur Aristote au même rythme.

Socrate ne remplace ni l’épreuve sur table, ni le jugement de l’enseignant, ni la règle que l’école doit écrire. Il rend possible, pour chaque étudiant, la modalité que les universités réservent aujourd’hui aux cas de doute.

Partager cet articleLinkedInXFacebook

Sur le même sujet