Transkribieren – so geht’s

So erstellst du ein KI-Voiceover für ein Video (Schritt für Schritt)

Du hast das Filmmaterial und ein Skript, aber kein Mikrofon, dem du vertraust — oder keine Stimme, die du vor der Kamera haben willst. Ein KI-Voiceover löst das: Skript einfügen, Stimme wählen, MP3 herunterladen und an deinen Schnitten ausrichten. Hier ist der komplette Ablauf, von Anfang bis Ende, in etwa fünf Minuten.

Was du brauchst

  • Dein Skript (oder die Zeilen, die vertont werden sollen).
  • Ein kostenloses Speecho-Konto — die Sprachgenerierung läuft nur mit Konto, damit deine Clips und Credits dir zugeordnet bleiben.
  • Deinen gewohnten Videoeditor (Premiere, DaVinci Resolve, Final Cut, CapCut — alles, was MP3 importiert).

Schritt 1 — Öffne den Voice-Tab und füge dein Skript ein

Wechsle in der App zum Tab Text-to-Speech und füge deine Narration in das Textfeld ein. Du kannst bis zu 20,000 Zeichen auf einmal verarbeiten — grob 20 Minuten Sprache — sodass die meisten einzelnen Videos in einem Rutsch passen. Teile ein längeres Stück in szenengroße Abschnitte; du platzierst sie auf der Timeline ohnehin einzeln.

Schritt 2 — Wähle eine Qualitätsstufe

Du siehst drei Stufen. Richte sie nach dem Video aus:

  • Standard (OpenAI) — sauber und natürlich, am günstigsten, 50+ Sprachen. Ideal für Tutorials und Entwürfe.
  • Enhanced (ElevenLabs Flash) — lebendiger und ausdrucksstärker. Die richtige Standardwahl für die meisten veröffentlichten Videos.
  • Premium (ElevenLabs Multilingual v2) — am natürlichsten, für deine wichtigsten Uploads.

Unsicher? Fang mit Enhanced an. (Eine ausführlichere Gegenüberstellung findest du in ElevenLabs vs. OpenAI: Welche Stimme brauchst du?.)

Schritt 3 — Wähle eine Stimme und höre sie kostenlos vor

Wähle eine Stimme, deren Ton zu deinem Kanal passt, und starte die Vorschau. Das ist kostenlos — du kannst jede Stimme in deiner Sprache anhören, bevor du ein einziges Credit ausgibst, also probier ein paar aus und vertrau deinen Ohren.

Schritt 4 — Erzeuge und lade die MP3 herunter

Zufrieden mit der Vorschau? Erzeuge den Clip. In wenigen Sekunden bekommst du einen Player, in dem du das Ergebnis prüfen, die Wiedergabegeschwindigkeit anpassen und eine Standard-MP3 herunterladen kannst. Diese Datei gehört dir und lässt sich jederzeit erneut herunterladen.

Schritt 5 — Zieh sie auf deine Timeline

Importiere die MP3 in deinen Editor und lege sie unter dein Filmmaterial. Weil du sie selbst platzierst — und nicht auf automatische Synchronisation angewiesen bist — behältst du die volle Kontrolle: Zeilen verschieben, um deine Schnitte zu treffen, einen Moment Stille vor einer Enthüllung einfügen, sie unter der Musik absenken. Genau diese manuelle Kontrolle willst du, wenn du entlang eines Skripts schneidest.

So bekommst du saubere, gut getaktete Narration

Ein paar Angewohnheiten lassen KI-Narration bewusst statt gehetzt klingen:

  • Setz Satzzeichen für den Atem. Kommas und Punkte werden zu Pausen. Kurze Sätze lesen sich laut besser als lange — schreib fürs Ohr.
  • Schreib knifflige Wörter lautgetreu, falls ein Name oder eine Abkürzung falsch ausgesprochen wird — etwa „Speecho” als „Spietscho” oder die Abkürzung „z. B.” ausgeschrieben als „zum Beispiel”.
  • Teile lange Absätze in separate Clips pro Szene auf. Das ist leichter zu platzieren und leichter, eine einzelne Zeile neu zu machen, ohne alles neu zu rendern.
  • Passe die Energie an den Inhalt an. Enhanced oder Premium für alles mit Persönlichkeit; Standard reicht für sachliche, nüchterne Narration.

Bonus: dasselbe Voiceover in einer anderen Sprache

Du willst eine Version des Videos in einer zweiten Sprache? Füge ein übersetztes Skript ein und erzeuge das Voiceover mit einer passenden Stimme — du bekommst eine saubere MP3 in dieser Sprache, die du auf ein Duplikat deiner Timeline legst. Wenn dein Video als Aufnahme begann, kannst du es sogar transkribieren und das Transkript zuerst in Speecho übersetzen und dann die Übersetzung vertonen.

Ein ehrlicher Vorbehalt: Das liefert dir Narration in einer anderen Sprache, kein automatisches Dubbing — es gibt keine Lippensynchronisation und keine automatische Abstimmung auf den Originalsprecher. Für Videos im Voiceover-Stil (Erklärvideos, Faceless-Kanäle, Produktdemos) ist das genau das Richtige; bei einem Talking-Head taktest du die Zeilen von Hand neu.

Was es kostet

Abrechnung pro Zeichen bedeutet, dass ein Voiceover günstig ist. Ein dreiminütiges Erklärvideo hat grob 3,000 Zeichen — etwa 30 Cent mit Standard oder 60 Cent mit Enhanced. Lade ab $5 auf, und da Credits nie verfallen, ist ein bisschen Extra-Guthaben nie verschwendet. Sieh dir die vollständige Preisübersicht an.

Bereit, deinem nächsten Video eine Stimme zu geben? Öffne den Voice-Tab, füge dein Skript ein und höre eine Stimme kostenlos vor.

Weiterlesen

Transkribieren – so geht’s

Interviews transkribieren für Journalisten: ein Workflow, der dem Faktencheck standhält

Eine Stunde Aufnahme kostet drei bis vier Stunden Abtippen. Wie Journalistinnen und Journalisten Interviews mit KI transkribieren, ohne je ein ungeprüftes Zitat zu drucken — plus die Quellenschutz-Fragen an jedes Tool.

28. Juli 2026 · 6 Min. Lesezeit
Transkribieren – so geht’s

Audio in Text umwandeln (schnell und meist kostenlos)

Vier Wege, eine Aufnahme in Text zu verwandeln – von Hand, mit kostenlosen Tools, mit KI oder mit einem menschlichen Dienst. Wann sich welcher lohnt und der schnellste Weg für die meisten.

10. Juli 2026 · 6 Min. Lesezeit
Ratgeber & Vergleiche

Professionelle Telefonansage erstellen: 8 Vorlagen + KI-Stimme

Fertige Ansagetexte für Begrüßung, Anrufbeantworter, Feiertage, Warteschleife und IVR-Menü — und wie daraus in etwa einer Minute eine professionelle MP3 mit KI-Stimme wird.

23. Juli 2026 · 6 Min. Lesezeit

Mach aus deiner nächsten Aufnahme Text

Audio oder Video hochladen und in Minuten ein sauberes Transkript, Untertitel, eine Zusammenfassung und Übersetzung erhalten.

Erste Datei kostenlos transkribieren → 15 Freiminuten · Credits verfallen nie · kein Abo