La description de vos documents existe déjà quelque part. Votre programme IA est en train de la refaire
Gartner : d'ici 2028, refaire soi-même les métadonnées du non structuré coûtera plus de 300 % de plus que reprendre l'existant. L'arbitrage se joue au cadrage.
Le 22 septembre 2026, au Gartner Data & Analytics Summit de Mumbai, Prasad Pore a formulé une prédiction que peu de programmes IA ont envie de lire : d’ici 2028, les responsables IA, data science et gestion de données tenteront de construire leurs propres solutions de métadonnées sur le non structuré, et supporteront des coûts supérieurs de plus de 300 % à ce qu’ils auraient dépensé en réutilisant les solutions, compétences et pratiques documentaires et d’archivage existantes. Le chiffre est spectaculaire. Ce qui l’est moins, et qui décide réellement, c’est le moment : cet arbitrage se joue pendant le cadrage, et il ne se rouvre pas. Une fois le premier référentiel maison en production, il devient la référence. Personne ne revient, dix-huit mois plus tard, sur un actif que des équipes ont construit, documenté et présenté en comité.
Cet article s’adresse au CDO, au CTO ou au responsable de la gestion des connaissances d’un grand groupe qui cherche à préparer son patrimoine documentaire pour l’IA et dont le programme a déjà buté sur son corpus. Si votre déploiement est encore un pilote fermé sur trois cents documents choisis, l’argument ne mord pas encore : il mordra au premier élargissement de périmètre. La personne pour qui ce texte est physiquement inconfortable n’est pas le lecteur : c’est le directeur du programme IA, celui à qui on va demander d’ouvrir le lot « taxonomie et métadonnées » déjà cadré, déjà staffé, déjà présenté, et d’admettre qu’une partie du travail est refaite. Il existe un moment précis où cette gêne est palpable, et la plupart des programmes l’ont déjà vécu : la revue où quelqu’un demande qui tiendra le référentiel une fois le projet clos, et où la réponse est un silence, puis l’engagement d’en reparler à la phase suivante.
Deux réponses arrivent avant même la fin de la lecture. La première : « nous construisons notre propre référentiel, personne ne connaît nos documents mieux que nous ». La seconde : « nous avons déjà l’outil, notre catalogue de données étend son périmètre au non structuré, ou notre GED a sorti un module IA ». Les deux sont défendables. Aucune des deux ne répond à la question que pose la prédiction de Gartner, qui ne porte pas sur l’outil mais sur le doublon : à quel endroit de l’entreprise la description de ce document est-elle déjà tenue, par qui, et à quelle date.
Un mot pour les lecteurs réguliers de ce blog. Les contenus des dernières semaines portaient sur ce que deux documents se disent l’un à l’autre : qui tranche quand deux d’entre eux se contredisent, et le périmètre sur lequel une contradiction est seulement détectable. Celui-ci change de famille de problème. Il ne parle pas de ce que vos documents disent, mais de ce que votre entreprise a déjà écrit à leur sujet, et que votre programme IA est en train de produire une deuxième fois.
Une précision avant d’entrer dans le sujet, parce que l’article emprunte sa méthode à une autre discipline. Le records management et l’archivistique écrivent depuis des décennies ce qu’un document est, qui en répond, combien de temps il vit et ce qui le remplace. Ce qui se transpose ici est la méthode, pas l’objet : il ne s’agit pas d’archiver, et cet article ne recommande ni un logiciel de records management, ni une GED, ni un plan de classement d’entreprise. La direction des archives n’en est pas non plus la destinataire, puisqu’elle a déjà fait ce travail. Le destinataire est celui qui finance aujourd’hui un chantier de description neuve sans avoir demandé ce qui existait.
Avant tout outillage, un geste tient en une demi-journée et ne suppose aucun équipement particulier. Prenez dix documents que votre assistant ou votre agent a effectivement servis le mois dernier. Si vous n’avez pas de journaux d’usage exploitables, prenez les dix documents que vos équipes réclament le plus souvent ; si vous n’avez ni l’un ni l’autre, prenez les dix documents que le métier cite en réunion, ou rien du tout et démarrez par une seule famille documentaire. Pour chacun, posez trois questions à des personnes qui ne se parlent pas : existe-t-il déjà, ailleurs dans l’entreprise, une description écrite de ce document ; qui la tient ; de quand date-t-elle. Comptez combien de fois la réponse est « oui, et voici où ».
La règle de lecture tient en une phrase, et il faut l’écrire avant de commencer, sans quoi l’exercice ne produit qu’un nombre. Si la réponse est « oui, et voici où » pour la majorité des dix, votre lot métadonnées doit être rouvert et rebasé sur les détenteurs existants avant d’être engagé. Si elle l’est pour un ou deux, le lot est légitime, et le relevé sert alors à consigner pourquoi, ce qui vaut mieux que de ne jamais avoir posé la question.
Ce que le chiffre de Gartner dit, et ce qu’il ne dit pas
La prédiction porte sur un coût comparé, pas sur une faute technique. Elle n’affirme pas que les référentiels maison échouent, ni que les équipes data font mal leur travail. Elle affirme qu’à périmètre équivalent, reconstruire un appareil descriptif sur le non structuré revient plus cher que reprendre celui qui existe. La même session de Mumbai pose deux ordres de grandeur qui expliquent pourquoi l’arbitrage devient visible maintenant : d’ici 2027, la dépense informatique consacrée à la gestion de données multistructurées représenterait 40 % du total dépensé en technologies et services de gestion de données, et entre 2025 et 2029 la part de la dépense IA consacrée à la préparation des données serait multipliée par sept. Le corpus documentaire est enfin financé. La question n’est plus de savoir s’il y aura un budget, elle est de savoir de quel côté il tombe.
Une prudence s’impose sur ce matériau : ce sont des prédictions d’analyste, qui décrivent une direction et ne chiffrent pas votre cas. Elles ne disent rien non plus de la méthode par laquelle vous établiriez, chez vous, l’écart entre les deux options.
Il faut aussi rendre justice au directeur de programme. Le chantier de description neuve relève d’une logique de pilotage : c’est le seul lot du programme qu’il peut cadrer sans dépendre du calendrier d’un métier. Une taxonomie se produit en sprints, avec des livrables datés et une équipe qu’il contrôle. Reprendre l’existant suppose d’aller demander à des gens qui ne lui sont pas rattachés ce qu’ils tiennent, comment, et depuis quand. Entre un lot maîtrisable et un lot dépendant, un programme sous pression de livraison choisit le premier. Le découpage des programmes produit mécaniquement ce choix.
Un chiffre daté situe le moment où cet arbitrage se pose, à condition de le lire pour ce qu’il est. Dans son rapport annuel publié le 18 mai 2026, à partir d’une enquête menée en mars 2026 auprès de 1 000 décideurs d’organisations de plus de 1 000 salariés en France, au Royaume-Uni, aux États-Unis et en zone DACH, Nasuni relève que 16 % des organisations interrogées traitent aujourd’hui la gestion des données non structurées comme un investissement informatique central, tandis que 60 % déclarent vouloir y investir dans les dix-huit mois. La source est un éditeur de plateformes de données non structurées : le chiffre vaut donc surtout comme aveu sur son propre marché, un marché qu’il décrit lui-même comme largement non priorisé à date. Et la fenêtre qu’il désigne est une saison plutôt qu’un événement : celle des cadrages budgétaires qui s’ouvrent maintenant et se referment sur des lots engagés.
Préparer son patrimoine documentaire pour l’IA commence par un inventaire que personne n’a fait
Dans un grand groupe de plus de cinq mille personnes, la description documentaire existe rarement à un seul endroit, et c’est précisément pour cela qu’elle est invisible. Elle vit dans le plan de classement d’une direction métier, dans le référentiel de conservation de la fonction archives, dans les métadonnées obligatoires d’une GED sectorielle, dans la nomenclature des pièces d’un processus qualité certifié, dans les registres d’un service juridique. Aucun de ces endroits ne couvre le patrimoine entier. Ensemble, ils en couvrent une part que personne, dans la plupart des organisations, n’a jamais dénombrée.
Appelons cela par son nom une fois, et une seule : la description refaite. Elle se constate en dénombrant, sur un référentiel réel, combien de documents portent déjà une description tenue ailleurs, par quelqu’un de nommé, avec une date de mise à jour. Le résultat est un dénombrement, et c’est exactement le type de mesure que K-AI produit avant toute recommandation.
C’est ici qu’une Document Knowledge Platform (DKP) intervient, au sens précis du triptyque Govern (gouverner le patrimoine documentaire : propriété, autorité, cycle de vie), Clean (détecter et traiter anomalies, doublons, obsolescence et contradictions) et Activate (n’exposer le corpus aux systèmes d’IA qu’une fois les deux étapes précédentes tenues). Une précision de rangement s’impose, parce que le décor de cet article appartient à une catégorie voisine : la DKP ne se vend pas dans la catégorie metadata management et n’a pas vocation à figurer dans l’appel d’offres correspondant. La gestion de métadonnées est ici le canal par lequel un problème documentaire devient visible et budgété, rien de plus. La DKP ne remplace ni un catalogue de données, ni une plateforme de gouvernance data ou IA, ni un ECM, ni un moteur de recherche d’entreprise : elle s’exécute avant eux, sur le patrimoine qu’ils consomment. Son unité de travail propre, que ni une excellente fonction archives ni un excellent catalogue de données ne produisent, tient en une ligne : mesurer l’état du contenu lui-même à l’échelle du patrimoine vivant, de manière reproductible, et router chaque cas vers un expert nommé qui tranchera. La fonction archives décrit et conserve, le catalogue référence et trace le lignage, la DKP mesure et route. Cette position ne dépend d’aucun calendrier d’analyste.
Sur le procédé lui-même, un mot de réassurance, au moment exact où il est décrit. Le matériau examiné est du contenu documentaire, jamais des transcriptions de conversations, des journaux d’usage ou de la télémétrie. Le périmètre d’ingestion est contractuel et borné. Rien n’est réutilisé pour entraîner des modèles. La validation du périmètre se fait conjointement par le Document Owner métier et le RSSI ou le DPO, jamais par la seule DSI.
Ce qu’un référentiel réel a montré, et la frontière de ce qu’il établit
Chez TotalEnergies Retail Power & Gas, dont le retour d’expérience est public et nommé, environ 500 pages de documentation web officielle alimentaient le chatbot client en production. La cartographie et l’audit ont été menés sans migration : les pages sont restées où elles étaient. 19 % d’entre elles étaient à corriger, y compris des cas qu’il était très difficile de repérer à l’œil à cette échelle. 53 % des cas ont été résolus en trois semaines, en priorisant les plus critiques, avec un à deux experts métier mobilisés une demi-journée à une journée par semaine. Thomas Bensoussan, Head of Digital Products, résume la valeur du dispositif par deux effets : faire apparaître des conflits difficilement repérables à l’œil, et indiquer vers quel expert orienter chaque cas. Les experts métier sont restés maîtres de la décision.
La frontière de cette preuve doit être dite clairement, y compris quand elle affaiblit la démonstration. Ce retour d’expérience établit une prévalence sur un référentiel précis, à un moment précis : ce qui était corrigeable, sur ces ~500 pages, lors d’un premier diagnostic. Il n’établit rien sur la question qui occupe cet article : il ne documente pas le coût comparé d’un chantier de métadonnées maison, et il ne dit pas si un actif descriptif neuf a été créé ou évité, parce que ce n’était pas l’objet de la mission. Ce qu’il apporte à l’arbitrage discuté ici tient en une phrase : la mobilisation métier nécessaire pour corriger un référentiel existant s’est comptée en demi-journées hebdomadaires sur trois semaines, ce qui donne un ordre de grandeur à ce que coûte la reprise. L’autre branche de la comparaison, ce que coûte la reconstruction chez vous, vous seul pouvez la produire, et c’est le rôle du relevé décrit ci-dessous.
Le relevé de reprise descriptive
Le geste de la demi-journée produit un artefact, et un seul. Appelons-le le relevé de reprise descriptive. Cinq colonnes : la famille documentaire, l’endroit où une description existe déjà, la personne ou la fonction qui la tient, la date de dernière mise à jour connue, et ce que le programme IA s’apprête à recréer sur ce périmètre. Une ligne remplie ressemble à ceci :
Conditions générales de vente, offre professionnels · Décrites dans le plan de classement de la direction juridique et dans le référentiel de conservation de la fonction archives · Tenues par la responsable de domaine juridique commercial · Dernière mise à jour déclarée lors de la révision tarifaire précédente · Le lot métadonnées du programme IA prévoit d’en reconstruire le typage et les règles de version.
Le relevé n’a pas vocation à devenir un document autonome : un artefact créé pour l’occasion n’a ni propriétaire ni cycle de vie. Ses lignes vivent en annexe du dossier de cadrage du programme IA, à côté du registre des cas d’usage, et c’est le responsable du cadrage qui le tient, pas une nouvelle fonction. Quant au moment où ses premières lignes s’écrivent, il est décisif : jamais pendant le sprint métadonnées, c’est-à-dire sous la pression de livraison que cet article désigne comme la cause du problème. Elles s’écrivent à froid, au cadrage, ou à la revue de portefeuille suivante, quand le lot n’est pas encore engagé. Le geste de la demi-journée et ce relevé forment un seul exercice : le geste produit les premières lignes, le relevé les conserve.
Deux conséquences à assumer, parce qu’un exercice dont on ne peut pas sortir abîmé n’est pas crédible. Si le relevé réussit, c’est-à-dire s’il montre qu’une description existe partout, bien tenue et à jour, vous venez de documenter qu’une partie de votre lot métadonnées est redondante, et quelqu’un devra l’arrêter ou le rebaser devant un comité qui l’avait validé. Le coût est politique, et il est réel. Ce relevé étant un écrit daté, il constitue par ailleurs une pièce que l’on pourra vous opposer plus tard, si le rebasement se révélait être une mauvaise décision. L’écrire reste préférable, pour une raison simple : la décision inverse, prise sans relevé, laisse elle aussi une trace, sous la forme d’un actif descriptif que personne ne sait rattacher à un propriétaire. Il s’agit ici d’une lecture argumentée, sans pratique établie ni décision publiée à l’appui ; faites-la qualifier par votre direction juridique avant d’en faire un standard.
Sur le financement, ce travail ne demande pas une ligne budgétaire nouvelle : il s’adosse au lot de cadrage du programme IA déjà arbitré, là où se décide le périmètre des données. La contrepartie se pose tout de suite, car l’adossement crée une dépendance de planning : si le cadrage glisse, le relevé glisse avec lui. Découpez-le par famille documentaire, de manière à ce que chaque famille traitée soit un livrable complet en elle-même.
Et si vous ne faites rien
L’option de ne rien faire mérite d’être énoncée, avec ce qu’elle produit. Le lot métadonnées se déroule comme prévu. Il livre un référentiel descriptif neuf, cohérent, correctement documenté, qui fonctionne pour les cas d’usage du programme. Le lot aura tenu ses engagements. Ce qui arrive ensuite est plus discret : ce référentiel devient un deuxième appareil de description, en parallèle de ceux qui existaient, avec son propre rythme de mise à jour et son propre propriétaire. Les deux divergent lentement. Au premier contrôle qualité, au premier changement de fournisseur ou à la première question d’un auditeur sur la source faisant foi, quelqu’un doit dire lequel des deux fait référence. Et cette question, personne ne l’a tranchée, parce qu’elle n’appartenait au périmètre d’aucun des deux chantiers.
Cette responsabilité n’a pas de titulaire aujourd’hui, et elle n’appelle pas la création d’un poste. Elle se règle par une attribution écrite ajoutée à un rôle existant : propriétaire de processus, responsable de domaine, responsable qualité. Une ligne ajoutée à une fiche de rôle suffit. Notons au passage ce que K-AI prend en charge et ce qu’il ne prend pas : le dénombrement, la reproductibilité de la mesure et le routage vers le bon expert relèvent de la plateforme ; la décision de dire quel référentiel fait autorité reste au métier, et elle y restera.
Conclusion : auditer, nettoyer, surveiller
La séquence ne change pas, et elle commence plus tôt qu’on ne le croit. Auditer : dénombrer, sur un périmètre réel, ce qui est déjà décrit ailleurs et par qui, avant d’engager la moindre construction. Nettoyer : traiter ce qui est faux, périmé ou contradictoire dans les documents eux-mêmes, en laissant l’arbitrage aux experts métier. Surveiller : tenir la mesure dans le temps, parce qu’un patrimoine documentaire se redégrade dès qu’on cesse de le regarder. Le directeur de programme dont il était question en ouverture n’a pas besoin d’abandonner son lot. Il a besoin de savoir, avant de l’engager, quelle part de ce lot refait un travail que quelqu’un, dans son entreprise, tient déjà.
Foire aux questions
Notre catalogue de données étend son périmètre au non structuré. Cela ne couvre-t-il pas le sujet ?
Un catalogue de données décrit des actifs et leur lignage, et les éditeurs de cette catégorie étendent effectivement leur couverture au non structuré. La frontière est ailleurs : le catalogue référence le document, il ne mesure pas son état ni ne dit lequel de deux documents concurrents fait autorité. Cette mesure se fait en amont, sur le contenu, et son résultat alimente ensuite le catalogue.
Pourquoi ne pas simplement confier le sujet à notre fonction archives ?
Parce que ce n’est pas la même demande. La fonction archives tient la conservation et la description réglementaire d’un périmètre défini ; elle n’a ni le mandat ni les moyens de qualifier, à l’échelle du patrimoine vivant, ce qui alimente un assistant IA. En revanche, elle détient une partie de la réponse à la première question du relevé, et c’est généralement la personne que le programme IA n’a jamais appelée.
Quel est le cadre de confidentialité d’un tel examen ?
Le périmètre d’ingestion est contractuel et borné aux contenus documentaires désignés, à l’exclusion des transcriptions, journaux d’usage et télémétrie. Aucune donnée client n’est réutilisée pour entraîner des modèles. Le périmètre est validé conjointement par le Document Owner métier et le RSSI ou le DPO, jamais par la seule DSI.
Combien de temps avant de voir quelque chose d’exploitable ?
Cela dépend du périmètre retenu et de la disponibilité des experts métier, deux paramètres qui vous appartiennent. Le repère public disponible est celui du référentiel de TotalEnergies Retail Power & Gas : sur environ 500 pages web, 53 % des cas identifiés ont été résolus en trois semaines avec un à deux experts mobilisés une demi-journée à une journée par semaine. C’est un ordre de grandeur daté sur un périmètre connu, et il ne se transpose pas tel quel.
Faut-il migrer nos documents pour faire cet exercice ?
Non. L’audit du référentiel TotalEnergies Retail Power & Gas a été mené sans migration, les pages restant à leur emplacement d’origine. C’est d’ailleurs le point qui distingue cette démarche d’un projet de refonte documentaire : elle ne déplace rien, elle mesure et elle route.
Sources
- Gartner Data & Analytics Summit 2026 India: Day 2 Highlights — Gartner, Mumbai, 22 septembre 2026 (session de Prasad Pore, prédictions sur les métadonnées du non structuré, la dépense multistructurée et la préparation des données pour l’IA).
- Nasuni Research Finds 97% of Enterprises Are Adopting AI Agents, Yet Most Projects Fail to Meet Objectives — Nasuni, 18 mai 2026, enquête Sapio Research menée en mars 2026 auprès de 1 000 décideurs d’organisations de 1 000 salariés et plus (États-Unis, Royaume-Uni, France, DACH).
- K-AI — page clients et retour d’expérience TotalEnergies Retail Power & Gas — chiffres du référentiel RPG cités dans cet article.
Pour aller plus loin
K-AI Corpus Diagnostic — 10 jours ouvrés, rapport complet des 20 anomalies les plus critiques de votre référentiel documentaire, garantie remboursement si aucune anomalie valable n’est détectée. Un échange d’une heure remplit les premières lignes de votre relevé de reprise descriptive : sur une famille documentaire de votre choix, ce qui est déjà décrit ailleurs, qui le tient, et ce que votre programme IA s’apprête à reconstruire dessus. Contactez l’équipe K-AI : contact@k-ai.ai. Le périmètre de chaque diagnostic est validé conjointement par le Document Owner métier et le RSSI/DPO, jamais par la seule DSI.
K-AI accompagne déjà CMA CGM, Veolia, PwC, BNP Paribas, TotalEnergies et CEVA Logistics. Partenaires : AWS, Snowflake, Microsoft, Wavestone, Devoteam.
