ToolCabana

Анализ порядка чтения PDF

Просматривает текстовые блоки PDF, отсортированные по координатам, и границы страниц.

Favorites are saved in this browser. Find them in My favorites.

Анализ порядка чтения PDF

Your input stays in this browser unless stated otherwise
Clear your input, files and result, and restore the default settings.

Drop your files here

or choose files from your device

Как использовать Анализ порядка чтения PDF

PDF reading order inspector shows how the text blocks on each PDF page are ordered once sorted by position, along with each page's width and height. Blocks whose vertical positions are within 3 points count as one line and are read left to right. The JSON report covers 1 to 100 pages and helps diagnose jumbled text extraction.

  1. Выберите исходный файл. Если инструмент принимает несколько файлов, расположите их в нужном порядке.
  2. Укажите максимальное число страниц.
  3. Запустите «Анализ порядка чтения PDF», просмотрите результат и используйте доступные элементы копирования или скачивания.

Что поддерживает этот инструмент

Извлекает существующий текстовый слой PDF в порядке координат. Для сканов сначала требуется OCR. Столбцы и сложные макеты могут потребовать ручной правки; JSON сохраняет номера страниц и ограничивающие рамки.

Максимум страниц
Range: 1 to 100

Ограничения и обработка

Изображения на входе: до 32 мегапикселей, пакеты до 10 изображений. Загрузки аудио и видео: 50 МБ; транскрипция: 120 секунд. Отредактированные видео: 20 секунд, 4 кадра/с и 640 пикселей в ширину. Перевод: английский/испанский, 30 000 символов; субтитры: 200 реплик. Нейросинтез речи: 1 000 символов английского текста. Загрузки моделей и требования к памяти зависят от устройства.

Пример исходных данных
A useful tool makes everyday work easier. Review the results before sharing.

Частые вопросы

Why is the text from my PDF extracted in the wrong order?

PDFs store text as positioned fragments, not as a reading sequence. This inspector lists each block with its coordinates in sorted order, so you can see where columns, sidebars or headers interleave with the main text.

How does the inspector decide the reading order?

Blocks are sorted by their distance from the top of the page. Blocks less than 3 points apart vertically are treated as the same line and ordered left to right. Multi-column layouts may still need manual correction.

Can I check the reading order of a scanned PDF?

Not until it has a text layer. Scanned pages contain only images, so the tool reports that no text layer was found. Run OCR on the PDF first, then inspect the result.

Где обрабатываются мои данные?

Обрабатывает исходные данные в вашем браузере. Копирование и скачивание выполняются только по вашему действию; исходные данные не сохраняются в истории учётной записи.

Каковы ограничения входных данных?

Изображения на входе: до 32 мегапикселей, пакеты до 10 изображений. Загрузки аудио и видео: 50 МБ; транскрипция: 120 секунд. Отредактированные видео: 20 секунд, 4 кадра/с и 640 пикселей в ширину. Перевод: английский/испанский, 30 000 символов; субтитры: 200 реплик. Нейросинтез речи: 1 000 символов английского текста. Загрузки моделей и требования к памяти зависят от устройства.