Generador automático de subtítulos
Transcribe voz a subtítulos SRT o WebVTT con marcas de tiempo.
Generador automático de subtítulos
Drop your files here
or choose files from your device
Cómo usar Generador automático de subtítulos
The automatic subtitle generator transcribes speech from an audio or video file and returns timestamped captions as SRT or WebVTT. It runs the Whisper tiny model in the browser after a one-time model download. You can leave the language blank for automatic detection or enter a code, and set how many seconds to transcribe from 1 to 120.
- Elige un archivo de origen. Si la herramienta acepta varios archivos, ordénalos como quieras.
- Configura el código de idioma (vacío = detectar), los segundos máximos y el formato de subtítulos.
- Ejecuta el generador automático de subtítulos, revisa la salida y usa los controles disponibles para copiar o descargar.
Qué admite esta herramienta
Descarga un modelo de inferencia del navegador en la primera ejecución y luego procesa la fuente localmente en un Web Worker cancelable. La eliminación de fondo usa BEN2; la transcripción usa Whisper tiny. Revisa los errores de reconocimiento y los bordes de imagen.
- Código de idioma (vacío = detectar)
- Set this value for your task.
- Segundos máximos
- Range: 1 to 120
- Formato de subtítulos
- SRT · WebVTT
Límites y procesamiento
Entradas de imagen: hasta 32 megapíxeles, lotes de hasta 10 imágenes. Subidas de audio/vídeo: 50 MB; transcripción: 120 segundos. Vídeos editados: 20 segundos, 4 fps y 640 píxeles de ancho. Traducción: inglés/español, 30,000 caracteres; subtítulos: 200 entradas. Voz neuronal: 1,000 caracteres en inglés. Las descargas de modelos y los requisitos de memoria varían según el dispositivo.
Fuente de ejemplo
A useful tool makes everyday work easier. Review the results before sharing.
Preguntas frecuentes
How long a video can I auto-generate subtitles for?
The tool transcribes from the beginning of the file up to the Maximum seconds value, which ranges from 1 to 120 with 30 as the default. Longer recordings need to be split and processed in parts.
Should I set a language code for automatic subtitles?
Leaving it blank lets Whisper detect the language. If detection picks the wrong language, enter a code such as en or fr. When no speech is recognized, the tool asks for a clearer recording.
Can I edit the timing of auto-generated subtitles?
The output is plain SRT or WebVTT text you can copy or download. Review words and timings against the audio, since the tool's notice warns that recognition errors happen. A subtitle timing editor can shift cues afterward.
¿Dónde se procesa mi entrada?
Los archivos y el texto de origen permanecen en este navegador. La primera ejecución descarga modelos públicos de Hugging Face y recursos locales del entorno de ejecución desde el sitio. Los modelos pueden quedar en la caché del navegador. No se requiere subir la fuente a Vercel, Supabase ni a un servicio de conversión.
¿Cuáles son los límites de entrada?
Entradas de imagen: hasta 32 megapíxeles, lotes de hasta 10 imágenes. Subidas de audio/vídeo: 50 MB; transcripción: 120 segundos. Vídeos editados: 20 segundos, 4 fps y 640 píxeles de ancho. Traducción: inglés/español, 30,000 caracteres; subtítulos: 200 entradas. Voz neuronal: 1,000 caracteres en inglés. Las descargas de modelos y los requisitos de memoria varían según el dispositivo.