Whisper, alojado

OpenAI Whisper, sem passar pelo terminal.

O Speecho funciona com o Whisper da OpenAI. Carregue um ficheiro no navegador e receba a mesma transcrição que teria numa instalação local — sem pip, sem CUDA e sem uma tarde perdida em erros de dependências.

Transcrever com o Whisper →
Nada para instalar, sem conta para começar. A partir de $0.83 por hora de áudio.

O que custa mesmo pôr o Whisper a correr por si

O modelo é gratuito. Tudo à volta dele não é.

🧰

A instalação

Python, ffmpeg, um ambiente virtual e a compilação certa do torch para a sua GPU. Uma tarde de erros de dependências antes da primeira transcrição.

Aqui: abre a página e larga o ficheiro. Nada para instalar e nada para manter atualizado.

🖥️

O hardware

Em CPU, o modelo grande corre mais devagar do que o tempo real — uma hora de áudio pode demorar bem mais de uma hora, com a ventoinha no máximo.

Aqui: corre em GPUs de servidor. Uma hora de áudio volta em minutos enquanto faz outra coisa.

A saída em bruto

O Whisper dá-lhe texto. Identificação de oradores, ficheiros de legendas, resumos e tradução são cada um um projeto à parte.

Aqui: os quatro voltam do mesmo carregamento, já feitos.

O que acrescentamos por cima do modelo

Precisamente as peças que se acaba por programar depois da primeira execução local.

Identificação de oradores

Cada linha atribuída a uma voz em gravações com vários oradores — entrevistas, painéis, reuniões. Depois substitui "Orador 1" por nomes reais.

Legendas prontas a usar

Exporte .srt e .vtt com quebras de linha e tempos sensatos, em vez de pós-processar os segmentos crus do Whisper até um leitor os aceitar.

99 idiomas à entrada, 18 à saída

A força multilingue do Whisper, mais a tradução da transcrição final para 18 idiomas e um resumo com IA do que foi dito.

Pay only for what you use

Top up once. Credits never expire. No subscription. One wallet for transcription, scans and captions.

New accounts get 15 free minutes to try — credits work for scans and captions too.

$5
2,400 credits
≈ 4h audio
$25
15,000 credits
+1,800
≈ 28h audio
$50
30,000 credits
+6,000
≈ 60h audio
✓ Speaker labels ✓ AI summary ✓ Translation to 18 languages ✓ TXT, SRT, VTT, Word, PDF export

Frequently asked questions

Isto é mesmo o OpenAI Whisper?

Sim. O Speecho transcreve com o Whisper — a mesma família de modelos que instalaria localmente, a correr em infraestrutura alojada. Não há outro motor por trás de um rótulo com forma de Whisper.

Não seria melhor correr o Whisper localmente?

Se tem uma GPU capaz, está à vontade com Python e transcreve constantemente, honestamente sim: em local paga eletricidade e o seu tempo de configuração, e nada por hora depois disso. O alojado faz sentido quando não tem o hardware, não quer manter a stack, ou quer identificação de oradores, legendas, resumos e tradução sem os construir.

Tenho de instalar alguma coisa?

Não. Corre no navegador — sem Python, sem ffmpeg, sem pesos de modelo para descarregar. Aos vídeos é extraído o áudio localmente antes do envio, por isso também não manda gigabytes pela rede.

Que idiomas suporta?

O Whisper transcreve 99 idiomas, e o Speecho traduz a transcrição final para 18. A precisão é maior com áudio limpo em idiomas muito falados, tal como em qualquer instalação local do Whisper.

O meu áudio é usado para treinar modelos de IA?

Não. As gravações não são usadas para treino, os ficheiros de origem são apagados após o processamento, e pode apagar transcrições do histórico quando quiser.

Quanto custa?

Entre $0.83 e $1.25 por hora de áudio, consoante o nível de modelo escolhido. Não há subscrição, os créditos nunca expiram, e recebe 15 minutos grátis ao confirmar o email.

Whisper, menos a tarde de configuração.

Transcrição, oradores, legendas, resumo e tradução a partir de um só carregamento.

Transcrever com o Whisper →