ToolCabana

Transcripción con etiquetas de hablante

Etiqueta segmentos de transcripción con un modelo configurado de diarización.

Favorites are saved in this browser. Find them in My favorites.

Transcripción con etiquetas de hablante

Your input stays in this browser unless stated otherwise
Clear your input, files and result, and restore the default settings.

Drop your files here

or choose files from your device

Cómo usar Transcripción con etiquetas de hablante

  1. Elige un archivo de origen. Si la herramienta acepta varios archivos, ordénalos como quieras.
  2. Configura el código de idioma (vacío = detectar) y los segundos máximos.
  3. Ejecuta la transcripción con etiquetas de hablante, revisa la salida y usa los controles disponibles para copiar o descargar.

Qué admite esta herramienta

Las marcas de tiempo de palabra de Whisper del navegador se combinan con la segmentación de Pyannote en un fragmento de 10 segundos, con hasta tres espacios anónimos de hablante. Las etiquetas no identifican a personas ni persisten entre ejecuciones. Revisa solapamientos y turnos breves.

Código de idioma (vacío = detectar)
Set this value for your task.
Segundos máximos
Range: 1 to 10

Límites y procesamiento

Hasta 10 segundos y tres espacios anónimos de hablante. Las etiquetas solo valen dentro del fragmento elegido y no son identidades de hablante. La primera inferencia descarga modelos de transcripción y segmentación.

Fuente de ejemplo
A useful tool makes everyday work easier. Review the results before sharing.

Preguntas frecuentes

¿Qué hace la transcripción con etiquetas de hablante?

Las marcas de tiempo de palabra de Whisper del navegador se combinan con la segmentación de Pyannote en un fragmento de 10 segundos, con hasta tres espacios anónimos de hablante. Las etiquetas no identifican a personas ni persisten entre ejecuciones. Revisa solapamientos y turnos breves.

¿Dónde se procesa mi entrada?

Los archivos y el texto de origen permanecen en este navegador. La primera ejecución descarga modelos públicos de Hugging Face y recursos locales del entorno de ejecución desde el sitio. Los modelos pueden quedar en la caché del navegador. No se requiere subir la fuente a Vercel, Supabase ni a un servicio de conversión.

¿Cuáles son los límites de entrada?

Hasta 10 segundos y tres espacios anónimos de hablante. Las etiquetas solo valen dentro del fragmento elegido y no son identidades de hablante. La primera inferencia descarga modelos de transcripción y segmentación.