OpenAI Whisper — ohne Terminal.
Speecho läuft auf OpenAIs Whisper. Lade eine Datei im Browser hoch und erhalte dieselbe Transkription wie bei einer lokalen Installation — ohne pip, ohne CUDA und ohne einen Abend voller Abhängigkeitsfehler.
Mit Whisper transkribieren →Was es wirklich kostet, Whisper selbst zu betreiben
Das Modell ist kostenlos. Alles drumherum nicht.
Das Setup
Python, ffmpeg, eine virtuelle Umgebung und der passende torch-Build für deine GPU. Ein Nachmittag voller Abhängigkeitsfehler vor dem ersten Transkript.
Hier: Seite öffnen, Datei hineinziehen. Nichts zu installieren und nichts aktuell zu halten.
Die Hardware
Auf der CPU läuft das große Modell langsamer als in Echtzeit — eine Stunde Audio kann deutlich über eine Stunde dauern, bei voller Lüfterdrehzahl.
Hier: Es läuft auf Server-GPUs. Eine Stunde Audio ist in Minuten zurück, während du etwas anderes machst.
Die rohe Ausgabe
Whisper liefert Text. Sprecher-Labels, Untertiteldateien, Zusammenfassungen und Übersetzung sind je ein eigenes Projekt.
Hier: Alle vier kommen aus demselben Upload zurück, fertig.
Was du zusätzlich zum Modell bekommst
Genau die Teile, die man sich nach dem ersten lokalen Lauf selbst schreibt.
Sprecher-Labels
Jede Zeile einer Stimme zugeordnet, bei Aufnahmen mit mehreren Sprechern — Interviews, Panels, Meetings. „Sprecher 1“ lässt sich danach umbenennen.
Untertitel, direkt nutzbar
Exportiere .srt und .vtt mit sinnvollen Zeilenumbrüchen und Timings, statt Whispers Rohsegmente nachzubearbeiten, bis ein Player sie akzeptiert.
99 Sprachen rein, 18 raus
Whispers Stärke in vielen Sprachen, dazu Übersetzung des fertigen Transkripts in 18 Sprachen und eine KI-Zusammenfassung des Gesagten.
Pay only for what you use
Top up once. Credits never expire. No subscription. One wallet for transcription, scans and captions.
New accounts get 15 free minutes to try — credits work for scans and captions too.
Frequently asked questions
Ist das wirklich OpenAI Whisper?
Ja. Speecho transkribiert mit Whisper — derselben Modellfamilie, die du lokal installieren würdest, betrieben auf gehosteter Infrastruktur. Es steckt keine andere Engine hinter einem Whisper-Etikett.
Sollte ich Whisper nicht lieber lokal laufen lassen?
Wenn du eine leistungsfähige GPU hast, mit Python vertraut bist und ständig transkribierst, dann ehrlicherweise ja — lokal kostet Strom und deine Einrichtungszeit, danach nichts pro Stunde. Gehostet lohnt sich, wenn die Hardware fehlt, du den Stack nicht pflegen willst, oder Sprecher-Labels, Untertitel, Zusammenfassungen und Übersetzung haben möchtest, ohne sie selbst zu bauen.
Muss ich überhaupt etwas installieren?
Nein. Es läuft im Browser — kein Python, kein ffmpeg, keine Modellgewichte zum Herunterladen. Bei Videodateien wird die Tonspur lokal extrahiert, du schickst also auch keine Gigabyte durchs Netz.
Welche Sprachen werden unterstützt?
Whisper transkribiert 99 Sprachen, und Speecho übersetzt das fertige Transkript in 18. Am genauesten ist es bei sauberem Audio in weit verbreiteten Sprachen — genau wie bei jeder lokalen Whisper-Installation.
Wird mein Audio zum Training von KI genutzt?
Nein. Aufnahmen fließen nicht ins Modelltraining, Quelldateien werden nach der Verarbeitung gelöscht, und du kannst Transkripte jederzeit aus deinem Verlauf entfernen.
Was kostet es?
Zwischen $0.83 und $1.25 pro Stunde Audio, je nach gewählter Modellstufe. Es gibt kein Abo, Guthaben verfällt nie, und du erhältst 15 Gratis-Minuten, wenn du deine E-Mail bestätigst.
Whisper — abzüglich des Setup-Nachmittags.
Transkript, Sprecher-Labels, Untertitel, Zusammenfassung und Übersetzung aus einem Upload.
Mit Whisper transkribieren →