Aller au contenu
6 octobre 2026 Dernier relevé : Les lunettes à intelligence artificielle sous le coup d’interdictions mondiales : un frein à l’innovation ?
FG2011
Biométrie en entreprise

OCR et IA en entreprise : automatiser le classement des documents scan

L’essentiel

OCR et IA : pourquoi la lecture seule ne suffit plus pour classer vos documents scannés, et les garde-fous RGPD à poser avant de déployer.

VOUS MACHINE
Photo JessBaileyDesign / Pixabay

Un bac de scanner qui déborde, une armoire numérique où personne ne retrouve le bon PDF du mois dernier : c’est le quotidien de pas mal de services administratifs. L’OCR seul faisait illusion il y a dix ans. Aujourd’hui, avec des volumes qui ont explosé, il montre ses limites presque tous les jours.

D’ailleurs, si vous devez juste transformer une page web en document exploitable sans sortir l’artillerie lourde, convertir une page web en pdf avec l’ia suffit largement pour un besoin ponctuel. Mais pour l’archivage massif de documents scannés en entreprise, c’est un tout autre sujet.

Pourquoi l’OCR seul ne suffit plus face au volume de documents

L’OCR classique sait lire du texte imprimé propre, sur un fond blanc, aligné. Dès qu’un bon de commande arrive tamponné, froissé, ou scanné à la va-vite avec un angle de 7 degrés, le taux d’erreur grimpe vite. J’ai vu des taux de reconnaissance tomber sous 70 % sur des factures manuscrites annotées à la main.

Le vrai problème n’est pas la lecture du texte, c’est le classement. Un service RH qui reçoit 200 scans par semaine (contrats, arrêts maladie, justificatifs de domicile) ne peut pas se permettre de les trier un par un. L’OCR extrait des caractères. Il ne sait pas dire si le document est une facture ou un bail.

Ce que l’IA ajoute : extraction, classement et reconnaissance d’image

C’est là que les modèles de vision entrent en jeu. Un système entraîné sur des milliers de documents similaires reconnaît la mise en page type d’une facture fournisseur, repère le numéro SIRET, extrait le montant TTC, et range le tout dans la bonne catégorie sans intervention humaine.

La différence tient dans la nature du traitement : l’OCR lit, l’IA comprend la structure. Elle distingue un en-tête d’un pied de page, repère qu’un tampon bancal n’empêche pas de lire la date, et apprend des corrections qu’on lui fait au fil des semaines.

Je ne recommanderais jamais un outil qui se contente d’afficher un score de confiance sans montrer où il se trompe. Un taux de 94 % de réussite ne veut rien dire si les 6 % restants sont justement les documents sensibles — un contrat de travail mal classé, ça coûte plus cher qu’une facture perdue.

Contrôle d’accès et badgeuse : des documents qui se mêlent au flux biométrique

Terminal de contrôle d'accès par badge en entreprise

Dans beaucoup d’entreprises, les registres d’accès générés par la authentification biométrique finissent eux aussi en PDF à archiver : rapports mensuels, exports de badgeuse, listes de présence pour un contrôle d’accès ponctuel. Ces documents suivent exactement le même circuit que les factures : scan, OCR, classement.

Le piège classique : traiter ces exports comme n’importe quel papier administratif, alors qu’ils contiennent des données personnelles liées à des horaires de présence. Un outil d’extraction qui ne distingue pas ce type de document d’une facture lambda range tout dans le même dossier partagé — et c’est exactement le genre d’oubli qui remonte un jour en contrôle CNIL.

Recherche autour de la conversion de pages web

70

recherches mensuelles pour « convertir page web en pdf gratuit » — un volume modeste, mais révélateur d’un besoin ponctuel bien différent de l’archivage massif de documents scannés en entreprise.

Les limites juridiques : RGPD et conservation des données extraites

Extraire automatiquement un nom, une date de naissance ou un numéro de sécurité sociale depuis un scan, c’est créer un traitement de données personnelles au sens du RGPD. Point. Ce n’est pas une option qu’on active si on a le temps.

La question que je pose systématiquement : combien de temps ces données extraites restent-elles stockées, et qui y accède ? Un outil d’extraction documentaire qui ne propose pas de durée de conservation paramétrable n’est pas prêt pour de la donnée RH ou de la biométrie associée à un badge.

L’AI Act ajoute une couche : un système qui classe automatiquement des documents liés à l’emploi (contrats, évaluations) entre dans une catégorie surveillée. Pas interdite, mais surveillée — avec une obligation de traçabilité sur les décisions prises par la machine.

Choisir un outil : portées d’accès et garde-fous avant déploiement

Avant de brancher quoi que ce soit sur votre serveur de fichiers, vérifiez ce que l’outil PEUT faire avec les droits qu’on lui donne — pas ce qu’il promet de faire. Un connecteur qui demande un accès en écriture sur l’ensemble du NAS pour classer des PDF a une portée disproportionnée par rapport à sa tâche.

Un budget de traitement non plafonné, dans un outil facturé à la page scannée, est le premier trou que je cherche en lisant une offre commerciale. Pas une case à cocher plus tard, un verrou dès le jour 1.

Mon avis tranché : pour un volume de moins de 500 documents par mois, un outil d’OCR classique couplé à un tri manuel reste largement suffisant, et évite d’exposer des données sensibles à un service tiers. Au-delà, l’IA de classement devient rentable — à condition d’exiger un journal d’audit sur chaque décision de tri automatique, pas seulement un disclaimer de conformité dans les conditions d’utilisation.

L’OCR et l’IA de classement, c’est la même chose ?

Non. L’OCR transforme une image en texte brut. L’IA de classement va plus loin : elle comprend la structure du document, identifie son type et l’oriente vers la bonne catégorie sans intervention humaine.

Un export de badgeuse doit-il être traité comme une facture ?

Non, justement. Un export de badgeuse contient des horaires de présence liés à une personne identifiée : c’est une donnée personnelle sensible, qui demande une conservation et un accès encadrés différemment d’une facture fournisseur.

Clara Blaise

Clara Blaise

recherche par image, reconnaissance faciale, vie privée et droit à l'image

Clara teste les moteurs de recherche par image et de reconnaissance faciale, et suit ce que la CNIL, le RGPD et l'AI Act permettent vraiment. Chaque test est refait sur ses propres photos avant publication.

Voir tous les articles de Clara Blaise →

Mis à jour le 5 octobre 2026

À lire aussi dans Biométrie en entreprise

Tout voir →