Разбивка текста на фрагменты
Разбивает текст на перекрывающиеся фрагменты по символам Unicode.
Разбивка текста на фрагменты
Как использовать Разбивка текста на фрагменты
Document chunk splitter cuts text into overlapping chunks of a fixed number of Unicode characters, for example to prepare content for retrieval or embedding. Chunk size ranges from 100 to 10,000 characters with an overlap smaller than the chunk size. The result is a JSON array listing each chunk's id, start and end positions and text.
- Вставьте исходные данные в редактор ввода или загрузите встроенный пример.
- Укажите число символов во фрагменте и число перекрывающихся символов.
- Запустите «Разбивка текста на фрагменты», просмотрите результат и используйте доступные элементы копирования или скачивания.
Что поддерживает этот инструмент
Разбивает текст на перекрывающиеся фрагменты по символам Unicode.
- Символов во фрагменте
- Range: 100 to 10000
- Перекрывающихся символов
- Range: 0 to 9999
Ограничения и обработка
Действуют ограничения браузера на файлы и текст, а также границы, указанные в настройках. Обработка изображений ограничена 32 мегапикселями. Качество OCR зависит от разрешения и компоновки исходных данных.
Пример исходных данных
A useful tool makes everyday work easier. Review the results before sharing.
Частые вопросы
What chunk size and overlap should I use for RAG?
The defaults are 1,200 characters with 150 characters of overlap. Size can be 100 to 10,000, and overlap can be 0 or more but must stay smaller than the chunk size.
Does the chunk splitter count tokens?
No. Chunks are measured in Unicode characters, counting each code point once, and the character count is not the same as a model token count.
Does the document chunk splitter break at sentences?
No. Chunks are cut at fixed character positions, with each new chunk starting the overlap distance before the previous one ended. Sentences and words can be split between chunks.
Где обрабатываются мои данные?
Обрабатывает исходные данные в вашем браузере. Копирование и скачивание выполняются только по вашему действию; исходные данные не сохраняются в истории учётной записи.
Каковы ограничения входных данных?
Действуют ограничения браузера на файлы и текст, а также границы, указанные в настройках. Обработка изображений ограничена 32 мегапикселями. Качество OCR зависит от разрешения и компоновки исходных данных.