Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

OCR : Baidu fait tenir des dizaines de pages en mémoire en imitant l'oubli humain

3 min de lecture · The Decoder · 5 juil. 2026 · IA générative · Pertinence : élevée

D'après Article original - The Decoder, relayé par The Decoder

OCR : Baidu fait tenir des dizaines de pages en mémoire en imitant l'oubli humain

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

À retenir

  • Le mécanisme R-SWA (attention à fenêtre glissante de référence) garde toujours accès à l'image du document, mais « oublie » activement le texte déjà généré au-delà des 128 derniers jetons (unités de texte).
  • Résultat : la mémoire technique (cache clé-valeur) reste de taille quasi fixe même si le document s'allonge, alors qu'un OCR classique voit sa mémoire grossir avec chaque page ajoutée.
  • Baidu rapporte environ 93 % de précision sur le banc d'essai OmniDocBench v1.5 et 93,92 % sur la version 1.6, avec une vitesse d'environ 5580 jetons par seconde contre 4951 pour le modèle de base DeepSeek OCR.
  • Le modèle (3 milliards de paramètres, dont environ 500 millions actifs à la fois) est publié en code source ouvert sous licence MIT sur GitHub et Hugging Face (baidu/Unlimited-OCR).
  • La limite reste réelle : la fenêtre de contexte totale plafonne à environ 32 000 jetons, donc le nombre de pages traitables dépend encore de la résolution des images et de la compression des jetons visuels.

Pourquoi ça compte

Les outils d'OCR (reconnaissance de texte dans une image) classiques ralentissent et consomment de plus en plus de mémoire à mesure qu'un document s'allonge, ce qui limite leur usage sur de gros documents administratifs, juridiques ou de recherche. En bornant la mémoire technique sans perdre l'accès au document source, Baidu propose une piste concrète pour traiter des dizaines de pages sans le compromis habituel entre longueur et vitesse - et le publie en code source ouvert, ce qui permet à d'autres équipes de le vérifier et de l'adapter.

Chiffre-clé

Le modèle atteint environ 5580 jetons traités par seconde en mode Base, contre 4951 pour le modèle de référence DeepSeek OCR, selon le document technique publié le 22 juin 2026 (arXiv:2606.23050).

Action concrète

Pour vulgariser : l'OCR sert à transformer une photo ou un scan en texte modifiable et cherchable. Les équipes qui numérisent de gros documents (contrats, rapports, archives) peuvent consulter le dépôt Hugging Face ou GitHub de baidu/Unlimited-OCR pour évaluer s'il traite leurs documents multi-pages plus rapidement qu'un pipeline OCR page par page classique.

Repères datés

Fondée sur la source originale

Sources

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !