# Dokumenten-Chunk-Splitter

> Teile Text in überlappende Unicode-Zeichen-Chunks auf.

[Open tool](https://www.toolcabana.com/de/rag-chunker) · [Entwicklung und Daten](https://www.toolcabana.com/de/category/developer-and-data)

Tool ID: rag-chunker. Requested language: de. Description language: de. Complete guide translation: yes.

## Overview (en)

Document chunk splitter cuts text into overlapping chunks of a fixed number of Unicode characters, for example to prepare content for retrieval or embedding. Chunk size ranges from 100 to 10,000 characters with an overlap smaller than the chunk size. The result is a JSON array listing each chunk's id, start and end positions and text.

## Supported tasks (de)

Teile Text in überlappende Unicode-Zeichen-Chunks auf.

## Steps (de)

1. Füge die Quelle in den Eingabe-Editor ein oder lade das integrierte Beispiel.
2. Lege Chunk-Zeichen und Überlappungszeichen fest.
3. Führe den Dokumenten-Chunk-Splitter aus, prüfe die Ausgabe und verwende dann die verfügbaren Bedienelemente zum Kopieren oder Herunterladen.

## Settings

- Chunk-Zeichen (de; key: size; type: number); minimum: 100; maximum: 10000
- Überlappungszeichen (de; key: overlap; type: number); minimum: 0; maximum: 9999

## Limitations (de)

Es gelten die Datei- und Textgrenzen des Browsers sowie die in den Einstellungen angezeigten Grenzen. Die Bildverarbeitung ist auf 32 Megapixel begrenzt. Die OCR-Qualität hängt von der Auflösung und dem Layout der Quelle ab.

## Example input

```text
A useful tool makes everyday work easier. Review the results before sharing.
```

## Privacy and connections (de)

Verarbeitet die Quelle in deinem Browser. Kopieren und Herunterladen sind ausdrückliche Aktionen; die Quelle wird nicht im Kontoverlauf gespeichert.

## Questions (de)

### What chunk size and overlap should I use for RAG?

The defaults are 1,200 characters with 150 characters of overlap. Size can be 100 to 10,000, and overlap can be 0 or more but must stay smaller than the chunk size.

### Does the chunk splitter count tokens?

No. Chunks are measured in Unicode characters, counting each code point once, and the character count is not the same as a model token count.

### Does the document chunk splitter break at sentences?

No. Chunks are cut at fixed character positions, with each new chunk starting the overlap distance before the previous one ended. Sentences and words can be split between chunks.

### Wo wird meine Eingabe verarbeitet?

Verarbeitet die Quelle in deinem Browser. Kopieren und Herunterladen sind ausdrückliche Aktionen; die Quelle wird nicht im Kontoverlauf gespeichert.

### Welche Eingabelimits gelten?

Es gelten die Datei- und Textgrenzen des Browsers sowie die in den Einstellungen angezeigten Grenzen. Die Bildverarbeitung ist auf 32 Megapixel begrenzt. Die OCR-Qualität hängt von der Auflösung und dem Layout der Quelle ab.

## Related tools

- [PDF to Markdown](https://www.toolcabana.com/de/pdf-to-markdown)
- [Document to structured JSON](https://www.toolcabana.com/de/document-to-json)
- [Table image to CSV](https://www.toolcabana.com/de/table-image-to-csv)
- [Invoice field extractor](https://www.toolcabana.com/de/invoice-extractor)
