# Transcripción con etiquetas de hablante

> Etiqueta segmentos de transcripción con un modelo configurado de diarización.

[Open tool](https://www.toolcabana.com/es/speaker-transcript) · [Audio, vídeo y archivos](https://www.toolcabana.com/es/category/audio-video-and-files)

Tool ID: speaker-transcript. Requested language: es. Description language: es. Complete guide translation: yes.

## Overview (en)

The speaker-labelled transcript tool transcribes up to 10 seconds of audio and assigns each word segment to an anonymous speaker slot. It matches Whisper word timestamps to Pyannote speaker segmentation, both run in the browser, and supports up to three slots plus overlap labels such as Speakers 1 + 2. Results download as speakers.json with segments and speaker windows.

## Supported tasks (es)

Las marcas de tiempo de palabra de Whisper del navegador se combinan con la segmentación de Pyannote en un fragmento de 10 segundos, con hasta tres espacios anónimos de hablante. Las etiquetas no identifican a personas ni persisten entre ejecuciones. Revisa solapamientos y turnos breves.

## Steps (es)

1. Elige un archivo de origen. Si la herramienta acepta varios archivos, ordénalos como quieras.
2. Configura el código de idioma (vacío = detectar) y los segundos máximos.
3. Ejecuta la transcripción con etiquetas de hablante, revisa la salida y usa los controles disponibles para copiar o descargar.

## Settings

- Código de idioma (vacío = detectar) (es; key: language; type: text)
- Segundos máximos (es; key: duration; type: number); minimum: 1; maximum: 10

## Limitations (es)

Hasta 10 segundos y tres espacios anónimos de hablante. Las etiquetas solo valen dentro del fragmento elegido y no son identidades de hablante. La primera inferencia descarga modelos de transcripción y segmentación.

## Example input

```text
A useful tool makes everyday work easier. Review the results before sharing.
```

## Privacy and connections (es)

Los archivos y el texto de origen permanecen en este navegador. La primera ejecución descarga modelos públicos de Hugging Face y recursos locales del entorno de ejecución desde el sitio. Los modelos pueden quedar en la caché del navegador. No se requiere subir la fuente a Vercel, Supabase ni a un servicio de conversión.

## Questions (es)

### Can this tool identify who is speaking by name?

No. Labels like Speaker 1 are anonymous slots within the analyzed excerpt. They do not identify people and are not comparable between separate runs, as the tool's output notice states.

### Why is the speaker transcript limited to 10 seconds?

Speaker segmentation is run on a single short excerpt with up to three speaker slots. Maximum seconds can be set from 1 to 10, starting at the beginning of the file. Longer recordings need to be cut into short clips.

### What does Unknown mean in the speaker labels?

A segment is labelled Unknown when its timing does not overlap any speaker window found by segmentation. Short turns and overlapping speech may also be misassigned, so review each label.

### ¿Dónde se procesa mi entrada?

Los archivos y el texto de origen permanecen en este navegador. La primera ejecución descarga modelos públicos de Hugging Face y recursos locales del entorno de ejecución desde el sitio. Los modelos pueden quedar en la caché del navegador. No se requiere subir la fuente a Vercel, Supabase ni a un servicio de conversión.

### ¿Cuáles son los límites de entrada?

Hasta 10 segundos y tres espacios anónimos de hablante. Las etiquetas solo valen dentro del fragmento elegido y no son identidades de hablante. La primera inferencia descarga modelos de transcripción y segmentación.

## Related tools

- [Automatic subtitle generator](https://www.toolcabana.com/es/auto-subtitles)
- [Burn subtitles into video](https://www.toolcabana.com/es/burn-subtitles)
- [Word-highlight subtitles](https://www.toolcabana.com/es/word-subtitles)
- [Subtitle translator](https://www.toolcabana.com/es/subtitle-translate)
