ToolCabana

Inspecteur de l'ordre de lecture PDF

Inspecte les blocs de texte PDF triés par coordonnées et les limites de page.

Favorites are saved in this browser. Find them in My favorites.

Inspecteur de l'ordre de lecture PDF

Your input stays in this browser unless stated otherwise
Clear your input, files and result, and restore the default settings.

Drop your files here

or choose files from your device

Comment utiliser Inspecteur de l'ordre de lecture PDF

PDF reading order inspector shows how the text blocks on each PDF page are ordered once sorted by position, along with each page's width and height. Blocks whose vertical positions are within 3 points count as one line and are read left to right. The JSON report covers 1 to 100 pages and helps diagnose jumbled text extraction.

  1. Choisissez un fichier source. Si l'outil accepte plusieurs fichiers, classez-les dans l'ordre souhaité.
  2. Définissez le nombre maximal de pages.
  3. Lancez l'inspection de l'ordre de lecture PDF, vérifiez le résultat, puis utilisez les commandes de copie ou de téléchargement disponibles.

Ce que cet outil prend en charge

Extrait la couche de texte existante du PDF dans l'ordre des coordonnées. Les documents numérisés nécessitent d'abord un OCR. Les colonnes et les mises en page complexes peuvent nécessiter des corrections manuelles ; le JSON conserve les numéros de page et les zones de délimitation.

Nombre maximal de pages
Range: 1 to 100

Limites et traitement

Saisies d'images : jusqu'à 32 mégapixels, lots de 10 images maximum. Importations audio/vidéo : 50 MB ; transcription : 120 secondes. Vidéos modifiées : 20 secondes, 4 fps et 640 pixels de large. Traduction : anglais/espagnol, 30 000 caractères ; sous-titres : 200 répliques. Parole neuronale : 1 000 caractères en anglais. Le téléchargement des modèles et les besoins en mémoire varient selon l'appareil.

Exemple de source
A useful tool makes everyday work easier. Review the results before sharing.

Questions fréquentes

Why is the text from my PDF extracted in the wrong order?

PDFs store text as positioned fragments, not as a reading sequence. This inspector lists each block with its coordinates in sorted order, so you can see where columns, sidebars or headers interleave with the main text.

How does the inspector decide the reading order?

Blocks are sorted by their distance from the top of the page. Blocks less than 3 points apart vertically are treated as the same line and ordered left to right. Multi-column layouts may still need manual correction.

Can I check the reading order of a scanned PDF?

Not until it has a text layer. Scanned pages contain only images, so the tool reports that no text layer was found. Run OCR on the PDF first, then inspect the result.

Où ma saisie est-elle traitée ?

Traite la source dans votre navigateur. La copie et le téléchargement sont des actions explicites ; la source n'est pas enregistrée dans l'historique du compte.

Quelles sont les limites de saisie ?

Saisies d'images : jusqu'à 32 mégapixels, lots de 10 images maximum. Importations audio/vidéo : 50 MB ; transcription : 120 secondes. Vidéos modifiées : 20 secondes, 4 fps et 640 pixels de large. Traduction : anglais/espagnol, 30 000 caractères ; sous-titres : 200 répliques. Parole neuronale : 1 000 caractères en anglais. Le téléchargement des modèles et les besoins en mémoire varient selon l'appareil.