Détection de texte OCR et annotation de transcription

Comment Shaip a fourni une annotation de transcription au niveau des caractères et des cadres de délimitation au niveau des mots à partir de diverses sources textuelles (documents imprimés, écriture manuscrite, signalisation, plaques d'immatriculation, reçus), le tout constituant un ensemble de données OCR et d'intelligence documentaire de qualité professionnelle avec une précision de 99 %.

Détection de texte par reconnaissance optique de caractères (OCR) et annotation de transcription

Résumé du projet

À mesure que la reconnaissance optique de caractères (OCR) s'étend au-delà des documents imprimés propres pour s'intéresser au texte de scènes réelles et à l'intelligence documentaire, le client avait besoin d'un pipeline d'annotation capable de gérer divers types de textes, polices, orientations, langues et conditions de surface avec une précision spatiale et au niveau des caractères.

Shaip a construit le pipeline d'annotation de bout en bout couvrant le placement des boîtes englobantes au niveau des mots, la transcription exacte des caractères, l'étiquetage multi-attributs et l'assurance qualité spatiale et transcriptionnelle double — produisant des ensembles de données OCR prêts pour le modèle sur plus de 10 types de sources de texte.

Principales statistiques

Annotation par image

Des centaines de mots

Seuil de précision

99 %

Sources textuelles

10

Couches d'attributs

5

Défis

  • Annoter chaque instance de texte visible au niveau du mot — des centaines par image dense
  • La combinaison précision de la boîte englobante spatiale au transcription exacte au niveau des caractères en parallèle
  • Manipulation texte courbé, déformé par la perspective et pivoté sur les panneaux d'affichage et les étiquettes des produits
  • La transcription délavé, à faible contraste et partiellement occulté mots sans deviner des caractères illisibles
  • Gérant texte multilingue et multilingue au sein de la même image

Solution

Annotation spatiale au niveau des mots

Chaque occurrence de texte visible dans chaque image a été annotée individuellement à l'aide d'un cadre de délimitation précis au niveau du mot, capturant ainsi l'emplacement spatial exact de chaque élément textuel. Pour les images denses comme les reçus ou les formulaires, cela impliquait des centaines d'annotations individuelles par image, chacune préservant la précision de l'alignement de base.

Transcription au niveau des personnages

En plus du cadre de délimitation, les annotateurs ont transcrit le contenu textuel exact de chaque mot, y compris les chiffres, les caractères spéciaux, la ponctuation et les combinaisons alphanumériques. Ce double flux de travail — spatial et transcription — a été réalisé en parallèle, avec des règles de cohérence appliquées aux deux niveaux.

Couverture multi-sources

La couverture s'étendait à une gamme très diversifiée de sources : documents imprimés, notes manuscrites, signalisation routière, étiquettes de produits, plaques d'immatriculation, façades de magasins, panneaux d'affichage, reçus, factures, menus et champs de formulaires. Chaque type de source était accompagné de ses propres consignes d'annotation, adaptées à ses caractéristiques visuelles.

Étiquetage d'attributs à 5 niveaux

Chaque zone de texte annotée a été enrichie d'attributs couvrant l'orientation du texte (horizontale, verticale, diagonale), la langue et le type d'écriture, la lisibilité du texte (clairement lisible, partiellement lisible, totalement illisible), le style de police (imprimé ou manuscrit) et le type de fond (uni, à motifs, complexe). Cette riche couche d'attributs permet au modèle entraîné de gérer des conditions textuelles réelles très diverses, bien au-delà des capacités standard de la reconnaissance optique de caractères (OCR) de documents.

Seuil de visibilité et double assurance qualité

Des règles strictes encadraient les seuils de visibilité minimaux : les textes illisibles étaient signalés plutôt que devinés, garantissant ainsi l’intégrité des données. Chaque image annotée était soumise à un processus d’assurance qualité en deux étapes : vérification de la précision du cadre de délimitation et validation de l’exactitude de la transcription, avec un seuil d’exactitude de 99 % pour les deux étapes.

Description du projet

Type de jeu de données Niveau d'annotation Références Attributs QA Exactitude
Détection de texte par reconnaissance optique de caractères (OCR) + transcription Boîtes de mots + transcription de caractères Plus de 10 types de sources 5 couches d'attributs Contrôle qualité spatial double + transcription 99 %

Les résultats

  • Établi un pipeline de transcription double au niveau des mots (spatial) et des caractères pour l'IA OCR
  • Normalisé Couverture de plus de 10 sources textuelles couvrant des documents, des textes de scènes et des écrits manuscrits
  • Livré 5 couches d'attributs pour l'orientation, la langue, la clarté, la police et l'arrière-plan
  • facile Porte de précision à 99 % à la fois au niveau spatial et au niveau de l'assurance qualité de la transcription
  • Activé le client Numérisation de documents, reconnaissance optique de caractères (OCR) pour le commerce de détail, navigation, services bancaires et services juridiques Applications IA

Globalement, Shaip a contribué à transformer une exigence d'annotation de texte multi-sources en un pipeline OCR structuré et prêt pour la production, capable de prendre en charge la numérisation de documents, la détection de texte de scène, l'intelligence commerciale, l'automatisation bancaire et l'IA de conformité juridique avec une double précision spatiale et de transcription.

Icône de devis

Shaip a géré les cas particuliers de reconnaissance optique de caractères (OCR) que la plupart des fournisseurs ne peuvent pas traiter : textes incurvés, écritures mixtes, reçus illisibles, notes manuscrites. Leur double contrôle qualité, portant à la fois sur les cadres de délimitation et les transcriptions, nous a fourni des données d’entraînement exploitables.

— Directeur, IA documentaire

★★★★★
Icône de devis