ToolCabana

Transcrição com rótulos de locutor

Rotula segmentos de transcrição com um modelo configurado de diarização.

Favorites are saved in this browser. Find them in My favorites.

Transcrição com rótulos de locutor

Your input stays in this browser unless stated otherwise
Clear your input, files and result, and restore the default settings.

Drop your files here

or choose files from your device

Como usar Transcrição com rótulos de locutor

The speaker-labelled transcript tool transcribes up to 10 seconds of audio and assigns each word segment to an anonymous speaker slot. It matches Whisper word timestamps to Pyannote speaker segmentation, both run in the browser, and supports up to three slots plus overlap labels such as Speakers 1 + 2. Results download as speakers.json with segments and speaker windows.

  1. Escolha um arquivo de origem. Se a ferramenta aceitar vários arquivos, ordene-os como quiser.
  2. Configure o código de idioma (vazio = detectar) e os segundos máximos.
  3. Execute a transcrição com rótulos de locutor, revise a saída e use os controles disponíveis para copiar ou baixar.

O que esta ferramenta suporta

As marcas de tempo de palavra do Whisper do navegador são combinadas com a segmentação Pyannote em um trecho de 10 segundos, com até três espaços anônimos de locutor. Os rótulos não identificam pessoas nem persistem entre execuções. Revise sobreposições e turnos breves.

Código de idioma (vazio = detectar)
Set this value for your task.
Segundos máximos
Range: 1 to 10

Limites e processamento

Até 10 segundos e três espaços anônimos de locutor. Os rótulos valem somente dentro do trecho escolhido e não são identidades de locutor. A primeira inferência baixa modelos de transcrição e segmentação.

Fonte de exemplo
A useful tool makes everyday work easier. Review the results before sharing.

Perguntas frequentes

Can this tool identify who is speaking by name?

No. Labels like Speaker 1 are anonymous slots within the analyzed excerpt. They do not identify people and are not comparable between separate runs, as the tool's output notice states.

Why is the speaker transcript limited to 10 seconds?

Speaker segmentation is run on a single short excerpt with up to three speaker slots. Maximum seconds can be set from 1 to 10, starting at the beginning of the file. Longer recordings need to be cut into short clips.

What does Unknown mean in the speaker labels?

A segment is labelled Unknown when its timing does not overlap any speaker window found by segmentation. Short turns and overlapping speech may also be misassigned, so review each label.

Onde minha entrada é processada?

Os arquivos e o texto de origem permanecem neste navegador. A primeira execução baixa modelos públicos do Hugging Face e recursos locais do ambiente de execução a partir do site. Os modelos podem ficar no cache do navegador. Não é preciso enviar a fonte ao Vercel, Supabase nem a um serviço de conversão.

Quais são os limites de entrada?

Até 10 segundos e três espaços anônimos de locutor. Os rótulos valem somente dentro do trecho escolhido e não são identidades de locutor. A primeira inferência baixa modelos de transcrição e segmentação.