Déchiffrer des textes codés, illisibles ou simplement trop nombreux pour être lus à la main: telle est l’ambition d’une équipe de l’École de technologie supérieure (ÉTS) à Montréal, qui conçoit une intelligence artificielle apte à traiter, en quelques instants, ce qui demanderait des années aux spécialistes. L’initiative cible des corpus allant des célèbres énigmes que sont les manuscrits « Borg » et « Voynich » aux archives moins connues, mais tout aussi précieuses, conservées au Vatican et dans des bibliothèques du monde entier.
Un goulet d’étranglement résolu par l’automatisation
Selon les estimations citées par les chercheurs, près de 1 % des manuscrits conservés sont partiellement ou totalement codés. À cela s’ajoutent des millions de documents dégradés, mal numérisés ou tout simplement jamais parcourus. L’équipe dirigée par Mohamed Cheriet, professeur au département de génie des systèmes, développe une IA qui « apprend comme un humain », pensée pour parcourir des collections entières et proposer des transcriptions ou des pistes de décodage à grande échelle.
« Quand il s’agit d’une collection de millions de pages, l’humain n’a pas la capacité de traiter de telles informations, il s’agit donc d’automatisation, de l’interprétation d’une collection de données. »
« Il y a des millions de documents qui n’ont pas été déchiffrés parce qu’il n’y a pas assez d’humains pour les étudier. »
Le cœur du projet consiste à franchir un seuil de productivité: la machine ne remplace pas le travail d’interprétation des historien·ne·s et linguistes, mais elle prétrie, classe et repère les régularités, rendant à nouveau explorables des fonds massifs, longtemps dormants faute de ressources humaines en nombre suffisant.
Au-delà de l’effet ChatGPT: une trajectoire entamée avant 2022
Cette percée s’inscrit dans une dynamique engagée bien avant la médiatisation récente des modèles conversationnels. Dès 2017, la chercheuse Beáta Megyesi, professeure de linguistique informatique à l’Université de Stockholm, et son équipe avaient réussi à décrypter un manuscrit vieux de 400 ans conservé au Vatican, le code Borg, grâce à des méthodes d’apprentissage automatique plus classiques. L’apport actuel des systèmes conçus à l’ÉTS tient à la capacité de passer à l’échelle, en combinant reconnaissance de formes, probabilités et boucles d’apprentissage adaptées à une hétérogénéité de sources.
Des mystères persistants, une méthode qui s’affine
Les manuscrits Voynich et Borg demeurent emblématiques des défis posés par les écritures chiffrées, les symboles ésotériques et les langues non identifiées. Des hypothèses circulent depuis des décennies, y compris l’idée de canulars pour certains documents. Mais l’enjeu dépasse ces cas célèbres: pour l’immense majorité des archives, le problème est la lisibilité matérielle (support abîmé, encre effacée, reproduction médiocre) et le simple volume à traiter. Les algorithmes offrent ici un levier d’indexation et de tri préalable, sur lequel les chercheur·euse·s peuvent ensuite bâtir des analyses linguistiques et historiques.
- Objectif principal : accélérer la lecture et le décryptage de vastes corpus manuscrits.
- Freins historiques : documents codés, supports dégradés, manque de personnel scientifique.
- Apport de l’IA : automatiser l’ingestion de millions de pages et proposer des amorces de déchiffrage.
Ce que change l’IA pour les bibliothèques et archives
Pour les institutions patrimoniales, souvent confrontées à des backlogs de numérisation et de description, l’IA joue un rôle de facilitateur. Elle peut prioriser des lots, repérer des motifs cryptographiques récurrents et signaler des segments prometteurs pour une expertise humaine. Dans le cas de corpus multilingues ou hétérogènes, cette approche réduit le temps nécessaire à faire émerger des contenus exploitables, sans prétendre résoudre d’emblée toutes les énigmes. Elle répond ainsi à une contrainte simple: il n’y a pas assez d’experts pour lire tout ce qui a été conservé.
Manuscrits cités et caractéristiques
| Manuscrit | Caractéristique | État d’avancement |
|---|---|---|
| Code Borg | Manuscrit codé, conservé au Vatican; environ 400 ans | Décryptage par apprentissage automatique (2017) |
| Voynich | Symboles et langue non identifiée | Objet de recherches, mystère persistant |
Prudence et promesses
Si l’IA « qui apprend comme un humain » ouvre des perspectives inédites, les chercheurs insistent sur la complémentarité avec l’expertise académique. Les modèles actuels excellent dans l’interprétation statistique de grandes masses de données, mais la validation historique, philologique et contextuelle reste du ressort des spécialistes. Les prochaines avancées viendront autant de la qualité des numérisations et de l’ouverture des collections que du raffinement des algorithmes.
Le message central demeure: face à des archives foisonnantes, l’automatisation conçue à l’ÉTS n’a pas pour vocation de remplacer la lecture savante, mais de lui ouvrir la voie. En réorientant l’effort humain vers les segments les plus prometteurs, elle pourrait faire remonter à la surface des pans entiers de connaissances encore inaccessibles.