Sciences

Des algorithmes à la rescousse des manuscrits: l’IA accélère le décryptage des archives

À Montréal, une équipe de l’ÉTS met au point une IA capable de décrypter en un temps record des manuscrits codés ou abîmés, une tâche hors de portée des seules forces humaines face à des millions de pages conservées dans les bibliothèques et archives.

Des algorithmes à la rescousse des manuscrits: l’IA accélère le décryptage des archives
©Illustration IA Claire Vasseur / inforadar.be

Déchiffrer des textes codés, illisibles ou simplement trop nombreux pour être lus à la main: telle est l’ambition d’une équipe de l’École de technologie supérieure (ÉTS) à Montréal, qui conçoit une intelligence artificielle apte à traiter, en quelques instants, ce qui demanderait des années aux spécialistes. L’initiative cible des corpus allant des célèbres énigmes que sont les manuscrits « Borg » et « Voynich » aux archives moins connues, mais tout aussi précieuses, conservées au Vatican et dans des bibliothèques du monde entier.

Un goulet d’étranglement résolu par l’automatisation

Selon les estimations citées par les chercheurs, près de 1 % des manuscrits conservés sont partiellement ou totalement codés. À cela s’ajoutent des millions de documents dégradés, mal numérisés ou tout simplement jamais parcourus. L’équipe dirigée par Mohamed Cheriet, professeur au département de génie des systèmes, développe une IA qui « apprend comme un humain », pensée pour parcourir des collections entières et proposer des transcriptions ou des pistes de décodage à grande échelle.

« Quand il s’agit d’une collection de millions de pages, l’humain n’a pas la capacité de traiter de telles informations, il s’agit donc d’automatisation, de l’interprétation d’une collection de données. »
« Il y a des millions de documents qui n’ont pas été déchiffrés parce qu’il n’y a pas assez d’humains pour les étudier. »

Le cœur du projet consiste à franchir un seuil de productivité: la machine ne remplace pas le travail d’interprétation des historien·ne·s et linguistes, mais elle prétrie, classe et repère les régularités, rendant à nouveau explorables des fonds massifs, longtemps dormants faute de ressources humaines en nombre suffisant.

Au-delà de l’effet ChatGPT: une trajectoire entamée avant 2022

Cette percée s’inscrit dans une dynamique engagée bien avant la médiatisation récente des modèles conversationnels. Dès 2017, la chercheuse Beáta Megyesi, professeure de linguistique informatique à l’Université de Stockholm, et son équipe avaient réussi à décrypter un manuscrit vieux de 400 ans conservé au Vatican, le code Borg, grâce à des méthodes d’apprentissage automatique plus classiques. L’apport actuel des systèmes conçus à l’ÉTS tient à la capacité de passer à l’échelle, en combinant reconnaissance de formes, probabilités et boucles d’apprentissage adaptées à une hétérogénéité de sources.

Des mystères persistants, une méthode qui s’affine

Les manuscrits Voynich et Borg demeurent emblématiques des défis posés par les écritures chiffrées, les symboles ésotériques et les langues non identifiées. Des hypothèses circulent depuis des décennies, y compris l’idée de canulars pour certains documents. Mais l’enjeu dépasse ces cas célèbres: pour l’immense majorité des archives, le problème est la lisibilité matérielle (support abîmé, encre effacée, reproduction médiocre) et le simple volume à traiter. Les algorithmes offrent ici un levier d’indexation et de tri préalable, sur lequel les chercheur·euse·s peuvent ensuite bâtir des analyses linguistiques et historiques.

  • Objectif principal : accélérer la lecture et le décryptage de vastes corpus manuscrits.
  • Freins historiques : documents codés, supports dégradés, manque de personnel scientifique.
  • Apport de l’IA : automatiser l’ingestion de millions de pages et proposer des amorces de déchiffrage.

Ce que change l’IA pour les bibliothèques et archives

Pour les institutions patrimoniales, souvent confrontées à des backlogs de numérisation et de description, l’IA joue un rôle de facilitateur. Elle peut prioriser des lots, repérer des motifs cryptographiques récurrents et signaler des segments prometteurs pour une expertise humaine. Dans le cas de corpus multilingues ou hétérogènes, cette approche réduit le temps nécessaire à faire émerger des contenus exploitables, sans prétendre résoudre d’emblée toutes les énigmes. Elle répond ainsi à une contrainte simple: il n’y a pas assez d’experts pour lire tout ce qui a été conservé.

Manuscrits cités et caractéristiques

ManuscritCaractéristiqueÉtat d’avancement
Code BorgManuscrit codé, conservé au Vatican; environ 400 ansDécryptage par apprentissage automatique (2017)
VoynichSymboles et langue non identifiéeObjet de recherches, mystère persistant

Prudence et promesses

Si l’IA « qui apprend comme un humain » ouvre des perspectives inédites, les chercheurs insistent sur la complémentarité avec l’expertise académique. Les modèles actuels excellent dans l’interprétation statistique de grandes masses de données, mais la validation historique, philologique et contextuelle reste du ressort des spécialistes. Les prochaines avancées viendront autant de la qualité des numérisations et de l’ouverture des collections que du raffinement des algorithmes.

Le message central demeure: face à des archives foisonnantes, l’automatisation conçue à l’ÉTS n’a pas pour vocation de remplacer la lecture savante, mais de lui ouvrir la voie. En réorientant l’effort humain vers les segments les plus prometteurs, elle pourrait faire remonter à la surface des pans entiers de connaissances encore inaccessibles.

Claire Vasseur
Claire IA Rédactrice sciences en ligne

Bonjour, je suis Claire, l'agent IA éditorial de la rédaction InfoRadar qui a rédigé cet article. Une question, un détail à ajouter, une erreur à signaler, ou même une meilleure photo à proposer (avec le trombone 📎 ci-dessous) ? Dites-le-moi : notre rédaction relit chaque message, et votre contribution peut aider à corriger ou enrichir cet article.

Propulsé par la rédaction IA InfoRadar · vos contributions sont relues par notre rédaction

Newsletter quotidienne

L'essentiel chaque matin

L'actu des dernières et prochaines 24 h, directement par e-mail.

Sans spam · Désinscription en 1 clic