ToolCabana

Documento para JSON estruturado

Exporte blocos de texto de PDF com números de página e caixas delimitadoras.

Favorites are saved in this browser. Find them in My favorites.

Documento para JSON estruturado

Your input stays in this browser unless stated otherwise
Clear your input, files and result, and restore the default settings.

Drop your files here

or choose files from your device

Como usar Documento para JSON estruturado

Document to structured JSON exports the text of a PDF as JSON, listing every page with its width and height and each text block with its text, x and y position, width and height. Blocks are sorted top to bottom and left to right. You can process up to 100 pages, and the file downloads as document.json.

  1. Escolha um arquivo de origem. Se a ferramenta aceitar vários arquivos, ordene-os como quiser.
  2. Defina o máximo de páginas.
  3. Execute a conversão de documento para JSON estruturado, revise a saída e use os controles disponíveis para copiar ou baixar.

O que esta ferramenta suporta

Extrai a camada de texto existente do PDF na ordem das coordenadas. Digitalizações exigem OCR primeiro. Colunas e layouts complexos podem precisar de correções manuais; o JSON mantém os números de página e as caixas delimitadoras.

Máximo de páginas
Range: 1 to 100

Limites e processamento

Entradas de imagem: até 32 megapixels, lotes de até 10 imagens. Uploads de áudio/vídeo: 50 MB; transcrição: 120 segundos. Vídeos editados: 20 segundos, 4 fps e 640 pixels de largura. Tradução: inglês/espanhol, 30,000 caracteres; legendas: 200 entradas. Voz neural: 1,000 caracteres em inglês. Os downloads de modelos e os requisitos de memória variam por dispositivo.

Fonte de exemplo
A useful tool makes everyday work easier. Review the results before sharing.

Perguntas frequentes

What does the JSON output of a PDF look like?

It is an object with a pages array. Each page has page, width, height and blocks, and each block has text, x, y, width and height, so you can locate every text run on the page.

What units are the coordinates in the PDF JSON?

Positions and sizes use PDF points at a scale of 1, matching the page width and height in the same output. The y value is measured from the top of the page, so larger values sit lower down.

Can I get JSON from a scanned PDF?

Only after OCR. The tool reads the existing text layer and reports that no text layer was found when pages are images. Make the PDF searchable with OCR first, then export it.

Onde minha entrada é processada?

Processa a fonte no seu navegador. Copiar e baixar são ações explícitas; a fonte não é salva no histórico da conta.

Quais são os limites de entrada?

Entradas de imagem: até 32 megapixels, lotes de até 10 imagens. Uploads de áudio/vídeo: 50 MB; transcrição: 120 segundos. Vídeos editados: 20 segundos, 4 fps e 640 pixels de largura. Tradução: inglês/espanhol, 30,000 caracteres; legendas: 200 entradas. Voz neural: 1,000 caracteres em inglês. Os downloads de modelos e os requisitos de memória variam por dispositivo.