ToolCabana

Документ в структурированный JSON

Экспортирует текстовые блоки PDF с номерами страниц и ограничивающими рамками.

Favorites are saved in this browser. Find them in My favorites.

Документ в структурированный JSON

Your input stays in this browser unless stated otherwise
Clear your input, files and result, and restore the default settings.

Drop your files here

or choose files from your device

Как использовать Документ в структурированный JSON

Document to structured JSON exports the text of a PDF as JSON, listing every page with its width and height and each text block with its text, x and y position, width and height. Blocks are sorted top to bottom and left to right. You can process up to 100 pages, and the file downloads as document.json.

  1. Выберите исходный файл. Если инструмент принимает несколько файлов, расположите их в нужном порядке.
  2. Укажите максимальное число страниц.
  3. Запустите «Документ в структурированный JSON», просмотрите результат и используйте доступные элементы копирования или скачивания.

Что поддерживает этот инструмент

Извлекает существующий текстовый слой PDF в порядке координат. Для сканов сначала требуется OCR. Столбцы и сложные макеты могут потребовать ручной правки; JSON сохраняет номера страниц и ограничивающие рамки.

Максимум страниц
Range: 1 to 100

Ограничения и обработка

Изображения на входе: до 32 мегапикселей, пакеты до 10 изображений. Загрузки аудио и видео: 50 МБ; транскрипция: 120 секунд. Отредактированные видео: 20 секунд, 4 кадра/с и 640 пикселей в ширину. Перевод: английский/испанский, 30 000 символов; субтитры: 200 реплик. Нейросинтез речи: 1 000 символов английского текста. Загрузки моделей и требования к памяти зависят от устройства.

Пример исходных данных
A useful tool makes everyday work easier. Review the results before sharing.

Частые вопросы

What does the JSON output of a PDF look like?

It is an object with a pages array. Each page has page, width, height and blocks, and each block has text, x, y, width and height, so you can locate every text run on the page.

What units are the coordinates in the PDF JSON?

Positions and sizes use PDF points at a scale of 1, matching the page width and height in the same output. The y value is measured from the top of the page, so larger values sit lower down.

Can I get JSON from a scanned PDF?

Only after OCR. The tool reads the existing text layer and reports that no text layer was found when pages are images. Make the PDF searchable with OCR first, then export it.

Где обрабатываются мои данные?

Обрабатывает исходные данные в вашем браузере. Копирование и скачивание выполняются только по вашему действию; исходные данные не сохраняются в истории учётной записи.

Каковы ограничения входных данных?

Изображения на входе: до 32 мегапикселей, пакеты до 10 изображений. Загрузки аудио и видео: 50 МБ; транскрипция: 120 секунд. Отредактированные видео: 20 секунд, 4 кадра/с и 640 пикселей в ширину. Перевод: английский/испанский, 30 000 символов; субтитры: 200 реплик. Нейросинтез речи: 1 000 символов английского текста. Загрузки моделей и требования к памяти зависят от устройства.