Un devis non publié, des données RH, un export CRM ou le code d’un produit ne deviennent pas anodins parce qu’ils sont collés dans une fenêtre de chat. Quand on associe IA et données sensibles, il faut donc chercher moins un nom de modèle miracle qu’un cadre d’usage vérifiable : où part la donnée, qui peut y accéder, combien de temps elle reste stockée et si elle sert, ou non, à entraîner le système.
Le choix change selon le métier. Un rédacteur peut surtout vouloir éviter de divulguer la stratégie éditoriale d’un client. Une équipe produit traite parfois des spécifications, des tickets et des logs. Un cabinet de conseil peut manipuler des informations contractuelles ou personnelles. Dans tous les cas, la protection ne dépend pas uniquement de l’IA : elle repose sur l’édition du service, son contrat, ses paramètres, l’identité des utilisateurs et les règles internes de l’organisation.
Le mot « sensible » recouvre deux réalités qu’il vaut mieux distinguer. Au sens juridique, les données sensibles sont une catégorie particulière de données personnelles définie par l’article 9 du RGPD : origine prétendument raciale ou ethnique, opinions politiques, convictions religieuses ou philosophiques, appartenance syndicale, données génétiques, biométriques, de santé, vie sexuelle ou orientation sexuelle. Leur traitement est interdit par principe, sauf exceptions limitées, comme le rappelle la définition de la CNIL.
Dans le langage de l’entreprise, on parle plutôt de données confidentielles : un contrat en négociation, une marge, une feuille de route produit, un code source, un dossier client, une vulnérabilité non corrigée. Aucune de ces informations n’est forcément personnelle, mais leur fuite peut coûter cher. Un projet sérieux associant IA et données sensibles doit traiter les deux familles, car un même document en contient souvent des deux sortes : un dossier d’aménagement de poste, par exemple, mêle organisation interne et informations de santé.

La réponse la plus prudente est la suivante : une IA est adaptée aux données sensibles lorsqu’elle propose des garanties explicites sur la non-utilisation des contenus pour l’entraînement, une gestion sérieuse des accès, des conditions de conservation maîtrisables et un cadre juridique compatible avec votre activité. Les offres grand public gratuites répondent rarement à ce niveau d’exigence. Elles restent utiles pour des exercices sans enjeu, des prompts fictifs ou de la veille, mais ne doivent pas devenir le canal par défaut pour des données confidentielles. Les réglages et les règles d’usage qui l’évitent sont détaillés dans notre guide pour sécuriser ses données dans les outils IA.
Pour des équipes qui travaillent déjà dans Microsoft 365 ou Google Workspace, les assistants intégrés à ces environnements peuvent être pertinents. Leur intérêt n’est pas seulement le modèle : il réside dans l’administration centralisée, la gestion des comptes professionnels, les politiques de sécurité et les droits déjà définis dans l’entreprise. Microsoft Copilot (anciennement Microsoft 365 Copilot) et Gemini dans Google Workspace s’inscrivent dans cette logique, à condition de vérifier précisément les licences, les périmètres de données indexés et les réglages activés par l’administrateur.
Les éditions professionnelles de ChatGPT, Claude ou d’autres assistants généralistes constituent une autre voie. Elles sont souvent plus pratiques pour la rédaction, l’analyse documentaire, le code ou la synthèse. Mais « offre entreprise » ne signifie pas automatiquement « conforme à tous les cas d’usage ». Il faut lire les engagements contractuels : entraînement sur les données clients, durée de rétention, localisation des traitements, sous-traitants, journalisation et modalités de suppression. Notre méthode pour choisir un assistant IA pour l’entreprise détaille cette grille de lecture.
Enfin, les modèles déployés dans un environnement que vous contrôlez offrent le niveau de maîtrise le plus élevé. Un modèle à poids ouverts (open weight), comme certaines familles Mistral, Llama ou Qwen, peut être exécuté sur une infrastructure interne ou chez un hébergeur sélectionné, par exemple pour faire tourner un agent IA open source sous votre contrôle. Cette approche convient aux données sensibles les plus critiques, aux contraintes de souveraineté ou aux workflows métier spécifiques. Son revers est réel : l’entreprise doit financer l’infrastructure, sécuriser les API, gérer les mises à jour, évaluer le modèle et maintenir les compétences techniques nécessaires.
Les promesses varient d’un éditeur à l’autre, et surtout d’une formule à l’autre chez le même éditeur. Voici ce que disent les documentations officielles, consultées en septembre 2026, sur le sort des données confidentielles de leurs clients professionnels. Elles évoluent régulièrement : relisez-les au moment de signer, et faites valider le contrat par votre DPO.
OpenAI indique que les contenus des formules ChatGPT Business, Enterprise et Edu, ainsi que ceux de son API, ne servent pas à entraîner ses modèles par défaut, sauf adhésion explicite du client. Des options de résidence des données en Europe existent pour ChatGPT Enterprise, ChatGPT Edu et l’API. À l’inverse, sur les comptes personnels Free, Plus et Pro, le partage pour l’entraînement est activé par défaut : il se coupe dans les paramètres de contrôle des données, via l’option « Améliorer le modèle pour tout le monde », comme l’explique le centre d’aide d’OpenAI.
Anthropic a modifié le 28 août 2025 les conditions de ses offres grand public Claude Free, Pro et Max : l’utilisateur choisit si ses conversations servent à améliorer les modèles. S’il accepte, la conservation passe à cinq ans ; s’il refuse, elle reste de 30 jours. Selon l’annonce officielle d’Anthropic, ce changement ne concerne pas les offres régies par les conditions commerciales : les formules Team et Enterprise, l’API, ainsi que l’accès via Amazon Bedrock ou Google Cloud Vertex AI. Un abonnement Pro payé à titre personnel n’est donc pas un canal adapté aux données confidentielles de l’entreprise.
Microsoft a rebaptisé Microsoft 365 Copilot en Microsoft Copilot, sans changement annoncé sur la sécurité ni la confidentialité. Selon sa page sur la protection des données d’entreprise, les prompts et les réponses bénéficient des mêmes engagements contractuels que les courriels d’Exchange ou les fichiers de SharePoint, et ni eux ni les données consultées via Microsoft Graph ne servent à entraîner les modèles de fondation.
Deux réserves figurent dans cette même page : les requêtes web envoyées à Bing relèvent d’un autre cadre, et les modèles d’Anthropic proposés dans Copilot sont pour l’instant exclus de la limite de données de l’UE (EU Data Boundary). Ces engagements valent pour Copilot utilisé par une organisation, avec un compte professionnel, pas pour l’application Copilot grand public ouverte avec un compte Microsoft personnel.
Côté Google, le centre de confidentialité de l’IA générative dans Workspace précise que vos contenus ne sont ni relus par des humains ni utilisés pour entraîner les modèles en dehors de votre domaine sans autorisation. Cet engagement vaut pour les éditions Workspace éligibles, pas pour un compte Gmail personnel, régi par les règles des applications Gemini grand public.
Ces deux assistants respectent les droits d’accès existants : ils ne voient que ce que l’utilisateur peut déjà ouvrir. C’est une force, mais aussi un révélateur. Un dossier RH contenant des données sensibles, partagé par erreur avec toute l’entreprise, devient d’un coup trouvable par une simple question. Avant d’activer un assistant de ce type, un audit des partages trop larges est souvent le chantier le plus rentable.
L’assistant de Mistral AI, longtemps appelé Le Chat, a été rebaptisé Vibe en 2026. L’origine européenne de l’éditeur ne dispense pas de régler les paramètres avant d’y déposer des données confidentielles. Selon le centre d’aide de Mistral, sur Vibe hors offre Enterprise, les entrées et les réponses servent par défaut à l’entraînement, sauf désactivation ; seuls les clients Enterprise en sont exclus par défaut. Détail à connaître : cliquer sur « pouce levé » ou « pouce baissé » autorise l’usage de l’échange noté, quel que soit le plan.
Deux outils utilisant un modèle similaire peuvent présenter des risques très différents. Le premier peut fonctionner en SaaS avec des données transmises à un fournisseur hors de votre périmètre. Le second peut passer par une instance dédiée, une région européenne ou un cloud privé. Le nom du modèle ne suffit donc pas à trancher : le débat entre modèles ouverts et propriétaires ne dit rien, à lui seul, de l’endroit où vos fichiers seront traités.
La première question à poser est simple : les prompts, les fichiers joints et les réponses sont-ils utilisés pour entraîner les modèles ? Dès que des données confidentielles sont en jeu, la réponse attendue est non, avec un engagement documenté. Méfiez-vous également des options activées par défaut et des différences entre l’interface grand public, une API et une formule entreprise. Une politique de confidentialité générale ne remplace pas un accord de traitement des données adapté à votre organisation.
La deuxième question concerne la rétention. Certains services conservent les échanges pour une période limitée à des fins de sécurité ou de débogage. D’autres permettent de régler cette durée, de la réduire ou de l’encadrer par contrat. Pour une équipe juridique, financière ou médicale qui manipule des données confidentielles, cette information est souvent plus déterminante qu’une différence marginale de qualité rédactionnelle entre deux modèles.
La troisième porte sur la localisation et les transferts. Héberger en Europe peut faciliter la gouvernance, mais ce n’est pas un label absolu de conformité. Il faut aussi examiner l’entité contractante, les accès de support, les sous-traitants et les mécanismes prévus en cas de transfert international. Le RGPD impose une analyse contextualisée dès que des données personnelles sont concernées, et le règlement européen sur l’IA s’y ajoute sans le remplacer.
Le RGPD reste la base. Pour un usage de l’IA qui touche des données personnelles, il faut une finalité définie, une base légale, une minimisation des données envoyées et une information des personnes. Lorsque le traitement présente un risque élevé, notamment s’il porte sur des données de santé ou sur des personnes vulnérables, une analyse d’impact relative à la protection des données (AIPD) s’impose. La CNIL a publié en 2024 et 2025 des fiches pratiques consacrées au développement des systèmes d’IA, dont une sur l’analyse d’impact : elles visent d’abord les concepteurs, mais une entreprise utilisatrice y trouvera la méthode de l’AIPD.
Pour l’hébergement, la qualification SecNumCloud de l’ANSSI fixe un haut niveau d’exigence. Elle ne se limite pas à des critères techniques : elle vise aussi à protéger les données sensibles et les traitements associés face à l’application de lois extraterritoriales. Parmi ces lois figure le CLOUD Act américain de 2018, qui permet aux autorités des États-Unis de demander des données à un fournisseur soumis à leur droit, même stockées hors du territoire américain. La liste des offres qualifiées est publiée par l’ANSSI sur sa page consacrée au cloud.
Le secteur de la santé ajoute une règle propre. En France, l’hébergement de données de santé collectées lors d’activités de prévention, de diagnostic, de soins ou de suivi social et médico-social pour le compte d’un tiers exige un hébergeur certifié HDS, en application de l’article L1111-8 du Code de la santé publique. Un assistant d’IA généraliste qui reçoit des comptes rendus médicaux, données sensibles au sens du RGPD, doit donc être examiné sous cet angle, en plus des règles générales de protection des données. Dans tous ces cas, une politique de gouvernance des données écrite évite de décider au coup par coup.
Pour comparer des plateformes, partez du flux de données plutôt que des promesses marketing. Quelles données sensibles ou confidentielles entrent dans l’outil ? Qui peut les déposer ? Que produit l’IA ? Où le résultat est-il ensuite enregistré ? Cette cartographie révèle fréquemment le point faible : un export téléchargé sur un poste non géré, un connecteur trop permissif ou un compte partagé entre plusieurs collaborateurs.
Vérifiez ensuite l’authentification et les droits. Le SSO, l’authentification multifacteur, la gestion des rôles et le provisionnement automatique ne sont pas des détails réservés aux grands groupes. Ils évitent qu’un ancien collaborateur conserve un accès à l’historique des conversations ou aux espaces partagés. Les journaux d’audit sont tout aussi utiles pour comprendre quel fichier a été envoyé, par qui et dans quel workflow.
Le chiffrement en transit et au repos est devenu un prérequis, pas un critère différenciant. Il faut aller plus loin : le fournisseur propose-t-il une isolation logique ou une instance dédiée ? Les clés sont-elles gérées par le client dans certaines configurations ? Les données peuvent-elles être supprimées à la demande ? Un administrateur peut-il désactiver l’historique, les connecteurs ou le partage externe ?
Pour les données personnelles, et a fortiori pour les données sensibles, demandez aussi un accord de traitement des données, la liste des sous-traitants et les modalités d’exercice des droits. Les secteurs régulés doivent ajouter leurs exigences propres : secret professionnel, hébergement de données de santé, exigences bancaires, règles de défense ou clauses contractuelles de leurs donneurs d’ordre. Dans ces environnements, la validation du DPO, du RSSI ou du service juridique doit précéder le déploiement, pas intervenir après les premiers usages.
La plus accessible est l’IA SaaS en formule professionnelle. Elle convient aux contenus internes à sensibilité modérée, aux notes de réunion, à la rédaction assistée et à l’analyse de documents préalablement nettoyés. Son avantage est la vitesse de mise en œuvre. Sa limite est la dépendance aux garanties du fournisseur et à la rigueur des utilisateurs.
Le deuxième niveau consiste à utiliser un modèle via une API ou un cloud d’entreprise, avec une région choisie, des identités gérées et des règles réseau. Cette architecture donne davantage de contrôle sur les applications et les données envoyées au modèle. Elle est bien adaptée à un chatbot interne, un assistant de recherche documentaire ou un workflow de génération connecté au SI. En contrepartie, elle demande une équipe capable de construire des garde-fous techniques.
Le troisième niveau est le déploiement privé ou auto-hébergé. C’est le choix le plus cohérent lorsque des données sensibles ne doivent jamais quitter un périmètre déterminé. Il permet aussi de combiner un modèle avec une base documentaire interne via RAG (génération augmentée par la recherche documentaire), sans confier cette base à un assistant public. Toutefois, l’auto-hébergement ne protège rien par magie : une API exposée, un serveur mal configuré ou des traces de logs non purgées peuvent annuler l’avantage initial.
Le meilleur réflexe consiste à classifier l’information avant de l’envoyer à une IA. Les contenus publics ou déjà publiés peuvent circuler avec peu de contraintes. Les données internes demandent une offre professionnelle et un compte administré. Les données confidentielles, personnelles, médicales, financières ou couvertes par un secret doivent suivre un processus validé, souvent avec anonymisation, pseudonymisation ou environnement dédié.

Le tableau ci-dessous reprend ces quatre niveaux avec des exemples concrets. Il donne un point de départ, pas une règle universelle : un contrat, un secteur ou une clause client peut imposer un niveau supérieur.
| Niveau de sensibilité | Exemples | Type d’offre acceptable |
|---|---|---|
| Public | Article publié, fiche produit en ligne, veille | Tout outil, y compris gratuit |
| Interne | Notes de réunion, procédures, brouillons | Offre professionnelle avec compte administré |
| Données confidentielles | Contrats, marges, code source, feuille de route | Offre entreprise sans entraînement, contrat et accord de traitement des données (DPA) signés, ou API dans un cloud choisi |
| Données sensibles ou réglementées | Santé, RH, données biométriques, secret professionnel | Environnement dédié ou auto-hébergé (SecNumCloud, HDS selon le cas), après AIPD |
Prenons un cas concret : une équipe marketing veut analyser les retours de clients pour préparer une campagne. Plutôt que de copier des verbatims bruts contenant noms, e-mails et références de commande, elle peut supprimer les identifiants directs, regrouper les commentaires dans un document contrôlé et demander une analyse thématique. Le résultat conserve l’essentiel de la valeur métier tout en réduisant l’exposition.
La même logique s’applique au code, qui contient souvent plus de données confidentielles qu’il n’y paraît. Évitez de transmettre des clés API, des secrets, des fichiers de configuration de production ou des extraits révélant une vulnérabilité non corrigée. Pour les développeurs, un filtre automatique avant envoi et des règles de détection de secrets dans le pipeline réduisent fortement le risque, comme nous le rappelons dans notre tour des usages de l’IA pour les développeurs. Pour les équipes éditoriales, des modèles de prompts peuvent rappeler d’anonymiser les noms de clients, les budgets, les clauses contractuelles et les autres données confidentielles.
Reste la question des règles internes. Une charte courte, qui liste les outils autorisés, les catégories de données confidentielles à ne jamais saisir et la personne à consulter en cas de doute, vaut mieux qu’une interdiction générale que personne ne respecte. Notre article sur l’usage de l’IA au travail détaille ce qu’une charte doit contenir et ce que l’employeur peut encadrer.
C’est déconseillé. Sur les comptes personnels, l’entraînement sur vos échanges est activé par défaut chez OpenAI et Mistral, et relève d’un choix de l’utilisateur chez Anthropic. Même désactivé, vous ne disposez ni d’un contrat de traitement des données ni d’une administration centralisée. Réservez ces comptes aux contenus publics ou fictifs.
Non. La localisation aide, mais l’entité contractante, les sous-traitants, les accès de support et l’exposition à des lois extraterritoriales comptent tout autant. Pour les besoins les plus stricts, la qualification SecNumCloud apporte une garantie que le seul hébergement européen ne donne pas.
Pas systématiquement. Elle devient nécessaire lorsque le traitement de données personnelles présente un risque élevé : données sensibles comme la santé, profilage ou surveillance des salariés, personnes vulnérables ou croisement de fichiers. La décision revient au responsable du traitement, qui doit recueillir l’avis du DPO (article 35 du RGPD), en s’appuyant sur la liste des traitements pour lesquels la CNIL exige une AIPD.
Pour ces données sensibles par excellence, il faut un environnement maîtrisé : si un prestataire héberge ces données pour vous, il doit être certifié HDS, le modèle doit tourner dans ce périmètre et une AIPD doit être réalisée en amont. Un assistant grand public, même payant, n’est pas conçu pour ce cas.
Pour concilier IA et données sensibles, l’outil le plus protecteur est celui qui s’insère dans un workflow maîtrisé, avec le bon niveau de service pour le niveau de risque. Avant d’ouvrir un nouveau compte ou de connecter une base documentaire, faites tester un cas réel mais anonymisé, validez les paramètres d’administration et désignez clairement les données qui ne doivent jamais franchir la frontière de votre organisation. Et quand le doute persiste sur des données sensibles, la règle la plus sûre reste de ne pas les envoyer.
© 2026 IAFocus - Tout sur l'Intelligence Artificielle en Français.
© 2026 IAFocus - Tout sur l'Intelligence Artificielle en Français.