Suddivisore di documenti in chunk
Suddivide il testo in chunk di caratteri Unicode sovrapposti.
Suddivisore di documenti in chunk
Come usare Suddivisore di documenti in chunk
Document chunk splitter cuts text into overlapping chunks of a fixed number of Unicode characters, for example to prepare content for retrieval or embedding. Chunk size ranges from 100 to 10,000 characters with an overlap smaller than the chunk size. The result is a JSON array listing each chunk's id, start and end positions and text.
- Incolla l'origine nell'editor di input, oppure carica l'esempio integrato.
- Imposta i caratteri per chunk e i caratteri di sovrapposizione.
- Esegui il suddivisore di documenti in chunk, esamina il risultato, poi usa i controlli disponibili per copiare o scaricare.
Cosa supporta questo strumento
Suddivide il testo in chunk di caratteri Unicode sovrapposti.
- Caratteri per chunk
- Range: 100 to 10000
- Caratteri di sovrapposizione
- Range: 0 to 9999
Limiti ed elaborazione
Si applicano i limiti del browser per file e testo, oltre ai limiti mostrati nelle impostazioni. L'elaborazione delle immagini è limitata a 32 megapixel. La qualità OCR dipende dalla risoluzione e dal layout dell'origine.
Origine di esempio
A useful tool makes everyday work easier. Review the results before sharing.
Domande frequenti
What chunk size and overlap should I use for RAG?
The defaults are 1,200 characters with 150 characters of overlap. Size can be 100 to 10,000, and overlap can be 0 or more but must stay smaller than the chunk size.
Does the chunk splitter count tokens?
No. Chunks are measured in Unicode characters, counting each code point once, and the character count is not the same as a model token count.
Does the document chunk splitter break at sentences?
No. Chunks are cut at fixed character positions, with each new chunk starting the overlap distance before the previous one ended. Sentences and words can be split between chunks.
Dove viene elaborato il mio input?
Elabora i dati di origine nel tuo browser. Copia e download sono azioni esplicite; l'origine non viene salvata nella cronologia dell'account.
Quali sono i limiti di input?
Si applicano i limiti del browser per file e testo, oltre ai limiti mostrati nelle impostazioni. L'elaborazione delle immagini è limitata a 32 megapixel. La qualità OCR dipende dalla risoluzione e dal layout dell'origine.