OpenAI Whisper, sin pasar por la terminal.
Speecho funciona con Whisper de OpenAI. Sube un archivo desde el navegador y obtén la misma transcripción que daría una instalación local — sin pip, sin CUDA y sin una tarde perdida entre errores de dependencias.
Transcribir con Whisper →Lo que cuesta de verdad ejecutar Whisper por tu cuenta
El modelo es gratis. Todo lo que lo rodea, no.
La instalación
Python, ffmpeg, un entorno virtual y la compilación de torch adecuada para tu GPU. Una tarde de errores de dependencias antes de la primera transcripción.
Aquí: abre la página y suelta el archivo. Nada que instalar y nada que mantener actualizado.
El hardware
En CPU, el modelo grande va más lento que el tiempo real: una hora de audio puede tardar bastante más de una hora, con el ventilador a tope.
Aquí: se ejecuta en GPUs de servidor. Una hora de audio vuelve en minutos mientras haces otra cosa.
La salida en bruto
Whisper te da texto. Etiquetas de hablante, archivos de subtítulos, resúmenes y traducción son cada uno un proyecto aparte.
Aquí: los cuatro vuelven de la misma subida, ya resueltos.
Lo que añadimos sobre el modelo
Justo las piezas que uno acaba programándose tras la primera ejecución local.
Etiquetas de hablante
Cada línea atribuida a una voz en grabaciones con varios hablantes — entrevistas, mesas redondas, reuniones. Después renombras "Hablante 1" con nombres reales.
Subtítulos listos para usar
Exporta .srt y .vtt con saltos de línea y tiempos sensatos, en vez de posprocesar los segmentos crudos de Whisper hasta que un reproductor los acepte.
99 idiomas de entrada, 18 de salida
La fuerza multilingüe de Whisper, más la traducción de la transcripción terminada a 18 idiomas y un resumen con IA de lo dicho.
Pay only for what you use
Top up once. Credits never expire. No subscription. One wallet for transcription, scans and captions.
New accounts get 15 free minutes to try — credits work for scans and captions too.
Frequently asked questions
¿Esto es realmente OpenAI Whisper?
Sí. Speecho transcribe con Whisper — la misma familia de modelos que instalarías en local, ejecutada en infraestructura alojada. No hay otro motor detrás de una etiqueta con forma de Whisper.
¿No sería mejor ejecutar Whisper en local?
Si tienes una GPU capaz, te manejas con Python y transcribes constantemente, honestamente sí: en local pagas la electricidad y tu tiempo de configuración, y nada por hora después. La versión alojada tiene sentido cuando no tienes el hardware, no quieres mantener el stack, o quieres etiquetas de hablante, subtítulos, resúmenes y traducción sin construirlos tú.
¿Tengo que instalar algo?
No. Funciona en el navegador — sin Python, sin ffmpeg, sin pesos de modelo que descargar. A los vídeos se les extrae el audio localmente antes de subirlos, así que tampoco envías gigabytes por la red.
¿Qué idiomas admite?
Whisper transcribe 99 idiomas, y Speecho traduce la transcripción terminada a 18. La precisión es mayor con audio limpio en idiomas muy hablados, igual que en cualquier instalación local de Whisper.
¿Mi audio se usa para entrenar modelos de IA?
No. Las grabaciones no se usan para entrenar modelos, los archivos de origen se borran tras el procesamiento y puedes eliminar transcripciones de tu historial cuando quieras.
¿Cuánto cuesta?
Entre $0.83 y $1.25 por hora de audio, según el nivel de modelo que elijas. No hay suscripción, los créditos no caducan y recibes 15 minutos gratis al confirmar tu correo.
Whisper, menos la tarde de configuración.
Transcripción, etiquetas de hablante, subtítulos, resumen y traducción de una sola subida.
Transcribir con Whisper →