Ce qu’une IA voit de vos dossiers, et ce que vous pouvez en prouver
Un modèle d’IA lit chaque dossier d’étudiant en clair. Ce que votre école peut en prouver dépend du montage : rien avec un assistant grand public, ce que le contrat écrit avec une offre professionnelle, ce qu’un tiers a vérifié avec une architecture qualifiée.
Le 24 septembre 2026, la MAIF a annoncé avoir retenu Scaleway pour son cloud et Mistral AI pour ses usages d’IA générative. Son communiqué range la souveraineté numérique parmi ses critères d’achat. LeMagIT ajoute un détail que le communiqué ne donne pas : l’infrastructure de Scaleway « est en cours de qualification SecNumCloud ». En cours, donc pas qualifiée.
Quatre jours plus tard, la LMU de Munich a fait le compte de sa fuite. Son communiqué du 28 septembre parle d’environ 600 000 dossiers, avec des données d’inscription qui remontent à une cinquantaine d’années.
Ces deux faits posent la même question à la DSI d’une école. Quand une IA lit les dossiers de vos étudiants, où vont les données, et que pouvez-vous en prouver ? La réponse dépend du montage. Il en existe trois, et chacun offre un niveau de preuve différent.
Une promesse contractuelle se lit. Une garantie d’architecture se vérifie. C’est la seconde qu’il faut demander.
Ce qu’une IA voit quand elle lit un dossier
Un modèle ne lit pas un dossier chiffré. Pour résumer une candidature, rapprocher un profil ou préparer une évaluation, il reçoit le texte en clair, au moment du traitement. Le chiffrement protège le dossier sur le disque et pendant le trajet. Il cesse de le protéger à l’instant où le modèle le lit.
Le Comité européen de la protection des données (CEPD) en tire une conséquence nette. Quand un prestataire doit accéder aux données en clair, et que le droit du pays où il opère autorise des accès trop larges, le CEPD ne voit aucune mesure technique capable d’empêcher cet accès. Un chiffrement dont le prestataire détient les clés ne compte pas comme une protection supplémentaire.
Le texte ne disparaît pas non plus après la réponse. Même sans entraînement, l’API d’OpenAI conserve des journaux de surveillance des abus jusqu’à 30 jours, sauf accord préalable pour une conservation nulle.
Trois questions suffisent donc à décrire n’importe quel montage :
- Où le dossier est stocké, et où il est traité.
- Qui peut y accéder, y compris pour administrer ou dépanner le service, et sous quel droit.
- Combien de temps il reste, chez vous et chez chaque prestataire.
La deuxième question est la plus souvent oubliée. Selon le CEPD , un accès depuis un pays tiers, même par un simple affichage à l’écran pour du support, constitue un transfert de données lorsque les critères de ses lignes directrices sont réunis. L’adresse du disque ne dit donc pas tout.
Un assistant grand public ne vous laisse rien à prouver
Le premier montage n’a rien d’un projet. Un intervenant colle une copie dans un assistant pour la corriger plus vite. Quelqu’un de la scolarité y dépose une liste d’inscrits pour la trier. Le phénomène se mesure en entreprise : selon Harmonic Security , qui a analysé 22,4 millions de requêtes de ses clients en 2025, 16,9 % des expositions de données sensibles passaient par des comptes personnels gratuits. L’étude ne porte pas sur le supérieur, et l’éditeur mesure ses propres clients. Elle montre quand même par où passent les données.
Dans ce montage, l’école n’a rien signé. Ce qui encadre les dossiers, ce sont les conditions d’utilisation du fournisseur, et elles varient :
- OpenAI peut utiliser les contenus de ses offres individuelles pour entraîner ses modèles, sauf si l’utilisateur le désactive dans ses réglages.
- Mistral entraîne par défaut ses modèles sur les échanges de son offre grand public, sauf opposition.
- Anthropic a changé en août 2025 les conditions de ses offres grand public : entraînement sur les conversations si l’utilisateur l’accepte, et conservation portée à cinq ans dans ce cas.
Le troisième exemple montre la limite du montage. Une condition d’utilisation change par un courriel. L’utilisateur choisit, et l’école n’a pas voix au chapitre.
La CNIL en tire une règle pratique. Quand le fournisseur peut réutiliser les données selon ses conditions, l’organisme doit décider au cas par cas s’il interdit d’y verser des données personnelles. Pour l’éducation, elle va plus loin : l’outil choisi ne doit pas réutiliser les données personnelles des élèves pour améliorer ses services.
Niveau de preuve : aucun. Vous pouvez lire les conditions du jour. Vous ne pouvez rien vérifier, et rien n’engage le fournisseur envers votre école.
Une offre sous contrat ne prouve que ce que le contrat écrit
Le deuxième montage est celui de la plupart des outils : une offre professionnelle, une API, ou un éditeur qui appelle un modèle pour vous. Cette fois, un contrat existe, et le RGPD en fixe le contenu.
L’article 28 du RGPD oblige le prestataire à ne traiter les données que sur vos instructions écrites, transferts hors de l’Union compris. Il ne peut pas faire appel à un autre sous-traitant sans votre autorisation écrite, et vous pouvez vous y opposer. Il doit vous fournir tout ce qui démontre le respect de ses obligations, et accepter vos audits, inspections comprises.
Les grands fournisseurs ont aligné leurs offres professionnelles sur ce cadre. Par défaut, OpenAI n’entraîne pas ses modèles sur les contenus de ChatGPT Business, Enterprise, Edu ni de son API. Anthropic exclut ses offres commerciales, Education et API du changement de 2025.
Le contrat répond bien à la question de l’entraînement. Il répond moins bien aux deux autres.
Stocké n’est pas traité. Lisez le verbe. En février 2025, la résidence européenne d’OpenAI distinguait deux promesses : les clients de l’API pouvaient « traiter » leurs données en Europe sur certains points d’accès, quand les clients ChatGPT Enterprise et Edu pouvaient « stocker leurs données au repos » en Europe. Le traitement en Europe est venu ensuite, pour des clients éligibles. La frontière européenne des données de Microsoft , achevée la même année, couvre le stockage et le traitement, sauf dans des « circonstances limitées » où des données continuent de sortir.
Localisé n’est pas protégé. Un contrat engage un fournisseur. Il ne lie pas le juge d’un autre pays. Le CLOUD Act oblige un fournisseur soumis au droit américain à communiquer les données qu’il contrôle, où qu’elles soient stockées. Interrogé par une commission d’enquête du Sénat en juin 2025 sur la transmission de données à des autorités étrangères, Anton Carniaux, de Microsoft France, a répondu : « Non, je ne peux pas le garantir, mais, encore une fois, cela ne s’est encore jamais produit. »
Le cadre qui autorise les transferts vers les États-Unis tient, pour l’instant. La décision d’adéquation date du 10 juillet 2023. Le Tribunal de l’Union a rejeté le recours qui la contestait le 3 septembre 2025, et un pourvoi a été formé devant la Cour de justice.
Niveau de preuve : ce que le contrat écrit. Vous pouvez le lire, le négocier et l’auditer. Il ne vous dit pas ce qu’un droit étranger peut exiger du fournisseur.
Une architecture qualifiée prouve ce qu’un tiers a vérifié
Le troisième montage ne demande plus de croire le fournisseur sur parole. Il s’appuie sur ce qu’un tiers a vérifié. En France, la référence s’appelle SecNumCloud : la qualification que l’ANSSI délivre aux services de cloud.
Le référentiel SecNumCloud 3.2 exige ce qu’un contrat ordinaire ne garantit pas :
- les données sont stockées et traitées dans l’Union ;
- le service est administré et supervisé depuis l’Union ;
- le prestataire a son siège dans l’Union, et son capital ne peut être détenu au-delà de 24 % par une seule entité extérieure à l’Union, ni au-delà de 39 % par plusieurs ;
- aucun tiers hors de l’Union ne doit avoir « la possibilité technique d’obtenir les données ».
Selon l’ANSSI , le but est de résister à une injonction issue de lois extraterritoriales. La qualification vaut trois ans, avec un audit de surveillance chaque année.
C’est ici que le cas de la MAIF devient utile, car « en cours de qualification » a un sens précis. L’ANSSI l’explique : une entreprise peut parler de sa démarche dès le courrier qui lui annonce le « jalon J0 », c’est-à-dire l’acceptation de sa demande. Elle ne peut pas afficher la qualification avant de l’avoir obtenue. Scaleway a franchi ce jalon en janvier 2025 et visait une qualification d’ici fin 2025 . En septembre 2026, sa page SecNumCloud la dit toujours en cours, et le catalogue de l’ANSSI mis à jour le 15 septembre ne la compte pas parmi les offres qualifiées.
Rien de cela ne juge le choix de la MAIF. Un achat souverain peut précéder la preuve. Mais une DSI qui lit « en cours » doit comprendre « demande acceptée », pas « exigences vérifiées ».
Deux autres précisions de l’ANSSI évitent les contresens. SecNumCloud qualifie une offre, pas un fournisseur. Et une offre hébergée sur une offre qualifiée n’est pas qualifiée pour autant : le logiciel posé dessus doit passer sa propre évaluation.
Pour une école privée, la qualification reste un choix. L’obligation posée par la loi SREN et son décret d’avril 2026 vise l’État, ses opérateurs et certains groupements d’intérêt public.
Une qualification ne dispense pas de regarder la conception du service. Le cloisonnement se joue à ce niveau : le 24 septembre, Cloudflare a détaillé une faille où un réglage de stockage de sa plateforme partagée laissait un client lire des restes de disque d’autres clients, un réglage qu’aucun contrat ne montrait. La trace de qui a lu quoi se vérifie aussi dans l’architecture, et l’affaire de la DGFiP montre ce qu’elle doit contenir.
Niveau de preuve : ce qu’un tiers a vérifié, et ce que vous pouvez constater vous-même.
Ce que le RGPD demande, et qu’un éditeur ne dit jamais
Les trois montages parlent d’accès. Le RGPD pose aussi une question de durée, celle que les éditeurs abordent le moins.
L’article 5 du RGPD interdit de garder des données identifiantes plus longtemps que leur finalité ne l’exige. L’article 13 impose d’indiquer cette durée à la personne, ou les critères qui la fixent.
La LMU montre ce que coûte une durée longue. Son communiqué décrit un système d’admission qui porte les données de tous les étudiants, actuels et anciens. Jusqu’en 1994, il garde des données de base et l’historique des semestres. Depuis 2005, il en garde davantage, dont parfois des coordonnées bancaires. Les mots de passe et les résultats d’examens ne sont pas touchés, et l’université n’avait, au 28 septembre, aucun indice de publication.
La LMU justifie cette durée par les attestations que demande l’assurance retraite, et par une conservation « d’environ 50 ans » qu’elle dit usuelle dans le supérieur. Elle reconnaît aussi que sa notice d’information annonçait « jusqu’à » 100 ans, une mention qu’elle juge trompeuse et qu’elle a corrigée. Une durée peut se justifier. Encore faut-il la fixer, l’écrire et l’appliquer.
En France, la CNIL distingue trois temps : la base active, l’archivage intermédiaire, l’archivage définitif. Elle ne publie pas de référentiel propre au supérieur. Pour les archives publiques, une instruction de 2005 fixe l’utilité administrative d’un dossier d’étudiant à 50 ans, ramenée à 10 ans si l’établissement garde un récapitulatif de sa situation. Ce texte vise les établissements publics. Une école privée fixe sa propre durée, et doit pouvoir la justifier.
Avec une IA, la question se multiplie. Chaque prestataire garde sa copie : la base de l’outil, les journaux du fournisseur de modèle, leurs sauvegardes. Deux articles du RGPD vous donnent prise sur chacune. L’article 28 vous fait connaître, et refuser au besoin, chaque sous-traitant ultérieur : vous savez ainsi quel fournisseur de modèle se tient derrière l’outil. L’article 32 demande une procédure pour tester et évaluer régulièrement l’efficacité des mesures de sécurité. Une mesure qui ne se teste pas ne se prouve pas.
Les questions à poser, montage par montage
Chaque question du tableau a deux réponses possibles. La première se lit dans un contrat. La seconde se constate.
Un fournisseur qui répond à la colonne du milieu vous donne une promesse. Un fournisseur qui répond à celle de droite vous donne de quoi la vérifier.
Ce que Subrequest pose dans l’architecture
Nous publions notre cadre sous un titre qui résume cet article : « Vos données, votre contrôle. Garanti par l’architecture. » Voici nos engagements, mot pour mot.
- Données cloisonnées. Une plateforme par école. Aucune donnée ne circule entre établissements.
- Hébergement européen. Vos données sont stockées dans l’Union européenne.
- Traçabilité. Chaque action est journalisée avec son auteur, son objet et son heure. Les preuves sortent quand l’audit les demande.
- Aucun entraînement tiers. Aucun modèle tiers ne s’entraîne sur vos données.
- Humain décisionnaire. Sur toute décision qui engage une personne, un humain garde le dernier mot.
- IA sous contrôle. Chaque agent s’active, se plafonne ou se coupe, campus par campus. L’outil fonctionne sans.
- RGPD & AI Act. Pris en compte dès la conception de la plateforme.
Le pilier « Les accès » du Socle place les humains et les agents IA sous les mêmes permissions. Ce que l’AI Act demandera aux écoles, et à quelle date, est traité dans AI Act : ce que le report de décembre 2027 ne reporte pas.
Lisez ces engagements comme ceux de n’importe quel éditeur : mot à mot. Les questions du tableau valent pour nous comme pour les autres. Posez-les-nous.