Traitement intelligent des documents (IDP) : OCR, LLM, contrôles et relecture humaine
Le traitement intelligent des documents expliqué : OCR ou LLM, contrôles, relecture humaine, avec factures, commandes et demandes de devis.

Sur cette page
Le traitement intelligent des documents (IDP, pour intelligent document processing) désigne un logiciel qui lit vos documents d’entreprise, comme les factures, les bons de commande ou les demandes de devis, en extrait les données utiles, les contrôle et les pousse dans vos systèmes, pour que les personnes ne traitent que les cas suspects. Il combine un OCR ou un modèle capable de lire les images, une étape d’extraction des bons champs, des règles de contrôle pour attraper les erreurs et une file de relecture humaine pour tout ce qui ne passe pas.
Le terme n’est pas nouveau, mais l’intérêt l’est. Dans notre export Google Keyword Planner (septembre 2025 à août 2026, requêtes anglophones), « intelligent document processing » et « ai document processing » se situent tous deux dans la tranche de 1 000 à 10 000 recherches mensuelles, avec une forte croissance sur un an. La raison est simple : les grands modèles de langage ont rendu l’extraction depuis des documents variés et désordonnés bien plus praticable que ne l’étaient les outils à modèles fixes.
En France, un contexte s’ajoute : depuis le 1er septembre 2026, toutes les entreprises assujetties doivent pouvoir recevoir des factures électroniques, et l’obligation d’émission s’étend aux PME et microentreprises au 1er septembre 2027. Une partie des factures arrive donc déjà sous forme structurée. Mais les bons de commande, demandes de devis, bons de livraison, justificatifs et factures étrangères restent des PDF, des e-mails et des photos. C’est là que l’IDP garde tout son intérêt.
Comment fonctionne l’IDP, étape par étape
| Étape | Ce qui se passe | Outils types |
|---|---|---|
| 1. Capture | Les documents arrivent par e-mail, dépôt, scanner, EDI ou portail | Boîte partagée, dossier surveillé, API |
| 2. Classification | Identifier le document : facture, commande, demande de devis, bon de livraison, autre | Règles, classifieur ou LLM |
| 3. Lecture | Transformer les pixels en texte et en mise en page | Moteur OCR ou modèle capable de lire les images |
| 4. Extraction | Trouver les champs : fournisseur, dates, lignes, totaux, références | Modèles fixes, extraction par apprentissage ou LLM avec un schéma |
| 5. Contrôle | Vérifier les valeurs avec des règles et vos données de référence | Code, consultations de l’ERP |
| 6. Relecture | Envoyer les échecs et les résultats peu fiables à une personne | File de relecture, interface simple |
| 7. Export | Écrire des données propres dans l’ERP, la comptabilité, le CRM ou un tableur | Intégrations, outils d’automatisation |
L’essentiel de la valeur, et du risque, se joue aux étapes 5 et 6. Les démonstrations mettent l’extraction en avant. C’est le contrôle qui empêche les mauvais chiffres d’entrer dans votre comptabilité.
OCR ou extraction par LLM
On les présente souvent comme concurrents. En pratique, ils ne font pas le même travail.
L’OCR (reconnaissance optique de caractères) transforme une image en texte. Un OCR moderne est très bon sur des scans propres et des PDF natifs, moins sur l’écriture manuscrite, les tampons, les photos de téléphone en basse résolution et les tableaux complexes. L’OCR seul ne sait pas que « 30 jours fin de mois » est une condition de paiement ni que le troisième nombre d’une ligne est un prix unitaire.
L’extraction par modèles fixes s’appuie sur l’OCR : vous indiquez au système « pour ce fournisseur, le numéro de facture est dans cette zone ». Précis et prévisible, mais chaque nouvelle mise en page exige un nouveau modèle. C’est pourquoi les anciens projets d’IDP calaient quand arrivait la longue traîne des fournisseurs.
L’extraction par LLM donne à un modèle de langage (souvent capable de lire les images) le document et un schéma : « renvoie le nom du fournisseur, le numéro de TVA, la date de facture, la devise, les lignes, le HT, la TVA et le TTC en JSON ». Il gère les nouvelles mises en page sans modèle et comprend le contexte, par exemple que « Adresse de livraison », « Ship-to » et « Lieferadresse » désignent la même chose.
| OCR + modèles fixes | Extraction par LLM | |
|---|---|---|
| Nouvelles mises en page | Nouveau modèle nécessaire | Fonctionne en général d’emblée |
| Prévisibilité | Élevée : même entrée, même sortie | Plus faible : peut varier et inventer des valeurs |
| Documents variés et désordonnés | Faible | Fort |
| Tableaux et lignes | Bon avec des modèles réglés | Bon, mais il faut contrôler le nombre de lignes et les totaux |
| Coût par page | Faible | Plus élevé, selon le modèle et la taille des pages |
| Explicabilité | Claire : cette zone, cette valeur | Demande un effort (exiger le texte source ou la position) |
La réponse pratique pour la plupart des entreprises : utiliser l’OCR ou la couche texte du PDF quand elle est fiable, confier à un LLM la mise en correspondance de ce texte avec un schéma strict, et ne jamais sauter les contrôles.
Les contrôles : d’où vient vraiment la précision
Un LLM qui a raison la plupart du temps produit quand même des erreurs à grande échelle, et les plus dangereuses ont l’air plausibles. Les contrôles transforment « probablement juste » en « vérifié ».
Contrôles utiles, à peu près par ordre de valeur :
- Arithmétique. Les lignes donnent le total HT ; HT plus TVA égale TTC ; quantité fois prix unitaire égale montant de la ligne.
- Données de référence. Le numéro de TVA du fournisseur figure dans votre fichier fournisseurs ; les références existent dans votre base articles ; le client d’une commande est un compte réel.
- Rapprochement entre documents. La facture correspond au bon de commande et au bon de réception (le rapprochement à trois voies classique).
- Règles de format. Dates valides et plausibles, IBAN dont la clé est correcte, numéros de TVA conformes au format du pays, SIREN cohérent.
- Détection des doublons. Même fournisseur, même numéro de facture, même montant déjà traité.
- Règles métier. Les montants au-dessus d’un seuil, les nouvelles coordonnées bancaires ou des conditions de paiement inhabituelles passent toujours par une personne.
Chaque contrôle réussi, c’est un point de moins à regarder. Chaque contrôle en échec envoie le document en relecture avec une raison claire.
La relecture humaine : concevoir la file
La relecture humaine n’est pas une faiblesse de l’IDP. C’est sa conception même.
- Relire par exception. Les personnes ne voient que les documents qui ont échoué à un contrôle ou sont sous un seuil de confiance, pas tout.
- Montrer la preuve. Le relecteur a besoin de la valeur extraite à côté de la zone surlignée sur l’original. Sans cela, la relecture est plus lente que la saisie manuelle.
- Capter les corrections. Chaque correction est un retour : une erreur récurrente sur un fournisseur peut appeler une règle, un ajustement du prompt ou un modèle.
- Ne jamais valider un paiement sur la seule extraction. Le changement de coordonnées bancaires est un vecteur de fraude classique (la fraude au faux fournisseur). Gardez une personne et une procédure de contre-appel à cet endroit.
La part de documents qui passent sans intervention dépend de votre mélange de documents et de la sévérité de vos contrôles. Mesurez-la sur vos propres documents pendant un pilote ; ne vous fiez pas au pourcentage affiché par un éditeur.
Trois exemples
Factures fournisseurs
Le point de départ le plus courant. Les factures arrivent en PDF dans une boîte partagée, ou via votre plateforme de réception. L’IDP extrait l’en-tête et les lignes, les rapproche des commandes et des réceptions, contrôle la TVA et les totaux, et crée des brouillons d’écritures propres dans le logiciel comptable. Les écarts partent vers la comptabilité fournisseurs avec leur motif. Si vous travaillez en cabinet, voyez l’IA pour les cabinets comptables pour les variantes côté clients.
Bons de commande clients
Les clients envoient leurs commandes dans leurs propres formats : PDF, Excel, corps d’e-mail. L’IDP extrait le client, l’adresse de livraison, les dates souhaitées et les lignes, fait correspondre les références client aux vôtres, vérifie les prix par rapport au tarif convenu et crée un brouillon de commande dans l’ERP. Les commandes avec écart de prix ou référence inconnue partent à l’administration des ventes. Cela peut à lui seul supprimer des heures de ressaisie par jour dans un service ADV chargé.
Demandes de devis dans l’industrie
Les demandes de devis sont plus désordonnées : un e-mail, un PDF de cahier des charges, parfois des plans. L’IDP peut extraire les données commerciales (client, quantités, matière, échéance, conditions de livraison) et résumer les exigences techniques pour le deviseur. Il ne doit pas chiffrer le travail seul. Exemple illustratif : un atelier d’usinage fait passer chaque demande reçue par e-mail dans une étape d’extraction qui remplit une fiche structurée et signale les informations manquantes (pas de quantité, pas de nuance de matière), pour que le deviseur puisse interroger le client avant de commencer. D’autres cas de ce type dans l’IA dans l’industrie.
L’IDP vaut-il la peine pour vous ?
Oui si vous traitez en volume les mêmes types de documents, si la ressaisie est un coût ou un goulot visible, et si les données ont un système de destination clair.
Non si les volumes sont minuscules, si chaque document est unique et demande de toute façon une lecture experte, ou s’il n’existe aucun système où placer les données. Dans ce cas, corrigez d’abord le processus. Notre guide pour mettre en place l’IA en entreprise explique comment choisir le premier projet.
Automatiser vos flux documentaires
Nous construisons des chaînes de traitement de documents pour les factures, les commandes et les demandes de devis : extraction, contrôle avec les données de votre ERP ou de votre comptabilité, file de relecture des exceptions et intégration dans vos systèmes. Pour les flux plus larges, voyez aussi notre service d’automatisation IA. Réservez un appel découverte et venez avec un échantillon de vrais documents.
FAQ
Les questions des marchands
Qu'est-ce que le traitement intelligent des documents ?
Le traitement intelligent des documents (IDP) est un logiciel qui lit des documents comme des factures, des bons de commande ou des demandes de devis, extrait les données utiles dans des champs structurés, les contrôle et les envoie dans vos systèmes. Une personne ne relit que les cas incertains.
Quelle différence entre OCR et IDP ?
L'OCR transforme une image de texte en texte. L'IDP va plus loin : il comprend quel texte est le numéro de facture, le total ou la date de livraison, contrôle ces valeurs avec des règles et vos données, et transmet le résultat à votre ERP, votre comptabilité ou votre CRM.
Les LLM sont-ils assez fiables pour extraire des données ?
Pour beaucoup de documents d'entreprise, ils sont très bons, surtout avec des mises en page variées. Mais ils peuvent produire des erreurs avec assurance : un système en production associe donc l'extraction par LLM à des règles de contrôle, des seuils de confiance et une relecture humaine de tout ce qui échoue à un contrôle.
Quels documents automatiser en premier ?
Les documents fréquents, avec une destination et des contrôles clairs : factures fournisseurs, bons de commande clients et confirmations de commande sont les premiers candidats classiques. Les documents rares, désordonnés et sans cible structurée sont de mauvais points de départ.


