Convierte cualquier vídeo en texto - y cuándo extraer antes el audio
Hay algo que todos los tutoriales de «vídeo a texto» omiten: la pista de vídeo es peso muerto. Un modelo de transcripción no mira ni un solo fotograma - oye el audio y nada más. Una grabación de pantalla de 500 MB lleva quizá 30 MB de sonido real, y los otros 470 MB existen solo para frenar tu subida.
Visto así, hay exactamente dos caminos sensatos, y elegir entre ellos lleva diez segundos.
Camino uno: sube el vídeo sin más
Speecho acepta MP4, MOV y WebM directamente, hasta cuatro horas de material. Lo que sorprende a la gente: el audio se extrae en tu navegador antes de subir nada. Sueltas una grabación de 2 GB, tu máquina saca la pista de sonido en local y solo ese archivo pequeño viaja al servidor. La subida tarda minutos, no la hora que sugiere el tamaño del archivo.
Esto cubre casi todos los casos reales, porque casi todo «vídeo» que alguien quiere transcribir ya es un archivo en su disco:
- una grabación de Zoom o Teams - es un MP4 en tu carpeta de descargas;
- un Loom - descárgalo primero de Loom, y es lo mismo;
- una grabación de Google Meet - llega a tu Drive como MP4;
- una clase, una entrevista o un episodio de pódcast que te enviaron como vídeo.
Si tu objetivo es el transcript y nada más, deja de leer aquí. Sube el vídeo y listo.
Camino dos: extrae antes el MP3
A veces quieres el audio como archivo, no solo el texto que lleva dentro. Para eso está nuestro extractor gratuito: funciona por completo en tu navegador, no se sube nada y te devuelve un MP3. Úsalo cuando:
- quieres conservar el audio - para un feed de pódcast, un archivo o escucharlo por el camino;
- el vídeo es enorme y tu conexión no - un MP3 de voz a 64 kbps de una reunión de una hora ronda los 30 MB, y eso sube en cualquier parte;
- la grabación dura más de cuatro horas - extrae el audio y envía eso;
- usarás el audio en más de un sitio - transcribir aquí, editar allá.
El extractor tiene un preajuste de «Voz» por algo: 64 kbps mono es exactamente lo que necesita un modelo de habla. Las voces se mantienen claras; solo sufre la música, y el modelo de todos modos no la estaba escuchando.
Qué pasa después de cualquiera de los dos
Lo mismo: transcripción con OpenAI Whisper en 99 idiomas con detección automática, etiquetas de hablante opcionales para entrevistas y reuniones, resumen con IA, traducción a 18 idiomas y exportación a Word o subtítulos. Pagas por hora de audio - desde 0,83 $ - sin suscripción, y al registrarte tienes 15 minutos gratis para probar con tu propia grabación en vez de con la demo de otro.
El único caso que ningún camino cubre
Un enlace no es un archivo. Si lo que tienes es una URL de streaming y no una grabación tuya, ni Speecho ni el extractor la aceptarán: admitimos archivos, no enlaces, y es deliberado. Descarga tu propia grabación de la plataforma que la guarda (Zoom, Loom y Meet lo permiten) y vuelves al camino uno.
Esa es toda la decisión: si solo quieres el texto, sube el vídeo; si también quieres el audio o el archivo es gigante, extrae primero. Ambos extremos se prueban gratis.