Whisper, gehostet

OpenAI Whisper — ohne Terminal.

Speecho läuft auf OpenAIs Whisper. Lade eine Datei im Browser hoch und erhalte dieselbe Transkription wie bei einer lokalen Installation — ohne pip, ohne CUDA und ohne einen Abend voller Abhängigkeitsfehler.

Mit Whisper transkribieren →
Nichts zu installieren, kein Konto nötig zum Starten. Ab $0.83 pro Stunde Audio.

Was es wirklich kostet, Whisper selbst zu betreiben

Das Modell ist kostenlos. Alles drumherum nicht.

🧰

Das Setup

Python, ffmpeg, eine virtuelle Umgebung und der passende torch-Build für deine GPU. Ein Nachmittag voller Abhängigkeitsfehler vor dem ersten Transkript.

Hier: Seite öffnen, Datei hineinziehen. Nichts zu installieren und nichts aktuell zu halten.

🖥️

Die Hardware

Auf der CPU läuft das große Modell langsamer als in Echtzeit — eine Stunde Audio kann deutlich über eine Stunde dauern, bei voller Lüfterdrehzahl.

Hier: Es läuft auf Server-GPUs. Eine Stunde Audio ist in Minuten zurück, während du etwas anderes machst.

Die rohe Ausgabe

Whisper liefert Text. Sprecher-Labels, Untertiteldateien, Zusammenfassungen und Übersetzung sind je ein eigenes Projekt.

Hier: Alle vier kommen aus demselben Upload zurück, fertig.

Was du zusätzlich zum Modell bekommst

Genau die Teile, die man sich nach dem ersten lokalen Lauf selbst schreibt.

Sprecher-Labels

Jede Zeile einer Stimme zugeordnet, bei Aufnahmen mit mehreren Sprechern — Interviews, Panels, Meetings. „Sprecher 1“ lässt sich danach umbenennen.

Untertitel, direkt nutzbar

Exportiere .srt und .vtt mit sinnvollen Zeilenumbrüchen und Timings, statt Whispers Rohsegmente nachzubearbeiten, bis ein Player sie akzeptiert.

99 Sprachen rein, 18 raus

Whispers Stärke in vielen Sprachen, dazu Übersetzung des fertigen Transkripts in 18 Sprachen und eine KI-Zusammenfassung des Gesagten.

Pay only for what you use

Top up once. Credits never expire. No subscription. One wallet for transcription, scans and captions.

New accounts get 15 free minutes to try — credits work for scans and captions too.

$5
2,400 credits
≈ 4h audio
$25
15,000 credits
+1,800
≈ 28h audio
$50
30,000 credits
+6,000
≈ 60h audio
✓ Speaker labels ✓ AI summary ✓ Translation to 18 languages ✓ TXT, SRT, VTT, Word, PDF export

Frequently asked questions

Ist das wirklich OpenAI Whisper?

Ja. Speecho transkribiert mit Whisper — derselben Modellfamilie, die du lokal installieren würdest, betrieben auf gehosteter Infrastruktur. Es steckt keine andere Engine hinter einem Whisper-Etikett.

Sollte ich Whisper nicht lieber lokal laufen lassen?

Wenn du eine leistungsfähige GPU hast, mit Python vertraut bist und ständig transkribierst, dann ehrlicherweise ja — lokal kostet Strom und deine Einrichtungszeit, danach nichts pro Stunde. Gehostet lohnt sich, wenn die Hardware fehlt, du den Stack nicht pflegen willst, oder Sprecher-Labels, Untertitel, Zusammenfassungen und Übersetzung haben möchtest, ohne sie selbst zu bauen.

Muss ich überhaupt etwas installieren?

Nein. Es läuft im Browser — kein Python, kein ffmpeg, keine Modellgewichte zum Herunterladen. Bei Videodateien wird die Tonspur lokal extrahiert, du schickst also auch keine Gigabyte durchs Netz.

Welche Sprachen werden unterstützt?

Whisper transkribiert 99 Sprachen, und Speecho übersetzt das fertige Transkript in 18. Am genauesten ist es bei sauberem Audio in weit verbreiteten Sprachen — genau wie bei jeder lokalen Whisper-Installation.

Wird mein Audio zum Training von KI genutzt?

Nein. Aufnahmen fließen nicht ins Modelltraining, Quelldateien werden nach der Verarbeitung gelöscht, und du kannst Transkripte jederzeit aus deinem Verlauf entfernen.

Was kostet es?

Zwischen $0.83 und $1.25 pro Stunde Audio, je nach gewählter Modellstufe. Es gibt kein Abo, Guthaben verfällt nie, und du erhältst 15 Gratis-Minuten, wenn du deine E-Mail bestätigst.

Whisper — abzüglich des Setup-Nachmittags.

Transkript, Sprecher-Labels, Untertitel, Zusammenfassung und Übersetzung aus einem Upload.

Mit Whisper transkribieren →