ToolCabana

Découpage de document en segments

Divisez le texte en segments de caractères Unicode avec chevauchement.

Favorites are saved in this browser. Find them in My favorites.

Découpage de document en segments

Your input stays in this browser unless stated otherwise
Clear your input, files and result, and restore the default settings.
Load sample text to explore what this tool can do. This replaces your current input.
0 charactersClear the source text.

Comment utiliser Découpage de document en segments

Document chunk splitter cuts text into overlapping chunks of a fixed number of Unicode characters, for example to prepare content for retrieval or embedding. Chunk size ranges from 100 to 10,000 characters with an overlap smaller than the chunk size. The result is a JSON array listing each chunk's id, start and end positions and text.

  1. Collez la source dans l'éditeur de saisie ou chargez l'exemple intégré.
  2. Définissez les caractères par segment et les caractères de chevauchement.
  3. Lancez le découpage de document en segments, vérifiez le résultat, puis utilisez les commandes de copie ou de téléchargement disponibles.

Ce que cet outil prend en charge

Divisez le texte en segments de caractères Unicode avec chevauchement.

Caractères par segment
Range: 100 to 10000
Caractères de chevauchement
Range: 0 to 9999

Limites et traitement

Les limites de fichiers et de texte du navigateur s'appliquent, ainsi que les bornes affichées dans les paramètres. Le traitement d'image est limité à 32 mégapixels. La qualité de l'OCR dépend de la résolution et de la mise en page de la source.

Exemple de source
A useful tool makes everyday work easier. Review the results before sharing.

Questions fréquentes

What chunk size and overlap should I use for RAG?

The defaults are 1,200 characters with 150 characters of overlap. Size can be 100 to 10,000, and overlap can be 0 or more but must stay smaller than the chunk size.

Does the chunk splitter count tokens?

No. Chunks are measured in Unicode characters, counting each code point once, and the character count is not the same as a model token count.

Does the document chunk splitter break at sentences?

No. Chunks are cut at fixed character positions, with each new chunk starting the overlap distance before the previous one ended. Sentences and words can be split between chunks.

Où ma saisie est-elle traitée ?

Traite la source dans votre navigateur. La copie et le téléchargement sont des actions explicites ; la source n'est pas enregistrée dans l'historique du compte.

Quelles sont les limites de saisie ?

Les limites de fichiers et de texte du navigateur s'appliquent, ainsi que les bornes affichées dans les paramètres. Le traitement d'image est limité à 32 mégapixels. La qualité de l'OCR dépend de la résolution et de la mise en page de la source.