ToolCabana

Расшифровка с разметкой говорящих

Размечает сегменты расшифровки с помощью настроенной модели диаризации.

Favorites are saved in this browser. Find them in My favorites.

Расшифровка с разметкой говорящих

Your input stays in this browser unless stated otherwise
Clear your input, files and result, and restore the default settings.

Drop your files here

or choose files from your device

Как использовать Расшифровка с разметкой говорящих

The speaker-labelled transcript tool transcribes up to 10 seconds of audio and assigns each word segment to an anonymous speaker slot. It matches Whisper word timestamps to Pyannote speaker segmentation, both run in the browser, and supports up to three slots plus overlap labels such as Speakers 1 + 2. Results download as speakers.json with segments and speaker windows.

  1. Выберите исходный файл. Если инструмент принимает несколько файлов, расположите их в нужном порядке.
  2. Укажите код языка (пусто = автоопределение) и максимальную длительность (с).
  3. Запустите «Расшифровка с разметкой говорящих», просмотрите результат и используйте доступные элементы копирования или скачивания.

Что поддерживает этот инструмент

Метки времени слов от Whisper в браузере сопоставляются с сегментацией Pyannote в пределах 10-секундного фрагмента, до трёх анонимных слотов говорящих. Метки не идентифицируют людей и не сохраняются между запусками. Проверьте перекрытия и короткие реплики.

Код языка (пусто = автоопределение)
Set this value for your task.
Максимальная длительность (с)
Range: 1 to 10

Ограничения и обработка

До 10 секунд, три анонимных слота говорящих. Метки применяются только в выбранном фрагменте и не являются идентификацией говорящих. При первом выводе загружаются модели транскрипции и сегментации.

Пример исходных данных
A useful tool makes everyday work easier. Review the results before sharing.

Частые вопросы

Can this tool identify who is speaking by name?

No. Labels like Speaker 1 are anonymous slots within the analyzed excerpt. They do not identify people and are not comparable between separate runs, as the tool's output notice states.

Why is the speaker transcript limited to 10 seconds?

Speaker segmentation is run on a single short excerpt with up to three speaker slots. Maximum seconds can be set from 1 to 10, starting at the beginning of the file. Longer recordings need to be cut into short clips.

What does Unknown mean in the speaker labels?

A segment is labelled Unknown when its timing does not overlap any speaker window found by segmentation. Short turns and overlapping speech may also be misassigned, so review each label.

Где обрабатываются мои данные?

Исходные файлы и текст остаются в этом браузере. При первом запуске загружаются публичные модели с Hugging Face и локальные компоненты среды выполнения с сайта. Модели могут оставаться в кэше браузера. Загрузка исходных данных в Vercel, Supabase или службу преобразования не требуется.

Каковы ограничения входных данных?

До 10 секунд, три анонимных слота говорящих. Метки применяются только в выбранном фрагменте и не являются идентификацией говорящих. При первом выводе загружаются модели транскрипции и сегментации.