Transcripción con etiquetas de hablante
Etiqueta segmentos de transcripción con un modelo configurado de diarización.
Transcripción con etiquetas de hablante
Drop your files here
or choose files from your device
Cómo usar Transcripción con etiquetas de hablante
- Elige un archivo de origen. Si la herramienta acepta varios archivos, ordénalos como quieras.
- Configura el código de idioma (vacío = detectar) y los segundos máximos.
- Ejecuta la transcripción con etiquetas de hablante, revisa la salida y usa los controles disponibles para copiar o descargar.
Qué admite esta herramienta
Las marcas de tiempo de palabra de Whisper del navegador se combinan con la segmentación de Pyannote en un fragmento de 10 segundos, con hasta tres espacios anónimos de hablante. Las etiquetas no identifican a personas ni persisten entre ejecuciones. Revisa solapamientos y turnos breves.
- Código de idioma (vacío = detectar)
- Set this value for your task.
- Segundos máximos
- Range: 1 to 10
Límites y procesamiento
Hasta 10 segundos y tres espacios anónimos de hablante. Las etiquetas solo valen dentro del fragmento elegido y no son identidades de hablante. La primera inferencia descarga modelos de transcripción y segmentación.
Fuente de ejemplo
A useful tool makes everyday work easier. Review the results before sharing.
Preguntas frecuentes
¿Qué hace la transcripción con etiquetas de hablante?
Las marcas de tiempo de palabra de Whisper del navegador se combinan con la segmentación de Pyannote en un fragmento de 10 segundos, con hasta tres espacios anónimos de hablante. Las etiquetas no identifican a personas ni persisten entre ejecuciones. Revisa solapamientos y turnos breves.
¿Dónde se procesa mi entrada?
Los archivos y el texto de origen permanecen en este navegador. La primera ejecución descarga modelos públicos de Hugging Face y recursos locales del entorno de ejecución desde el sitio. Los modelos pueden quedar en la caché del navegador. No se requiere subir la fuente a Vercel, Supabase ni a un servicio de conversión.
¿Cuáles son los límites de entrada?
Hasta 10 segundos y tres espacios anónimos de hablante. Las etiquetas solo valen dentro del fragmento elegido y no son identidades de hablante. La primera inferencia descarga modelos de transcripción y segmentación.