Creator & Medien

Untertitel-Regeln, die niemand erklärt: 17 Zeichen pro Sekunde - und warum deine hetzen

Automatisch erzeugte Untertitel sind meist korrekt und trotzdem unangenehm zu lesen. Die Wörter stimmen, das Timing sitzt auf die Millisekunde, und mit eingeblendeten Untertiteln zuzuschauen ist irgendwie anstrengend. Das ist kein Transkriptionsproblem, sondern ein Timing-Problem - und es hängt an vier Zahlen, die die Untertitelung im Rundfunk seit Jahrzehnten benutzt.

Die wichtigste Zahl: 17 Zeichen pro Sekunde

Die Lesegeschwindigkeit entscheidet alles. Ein Untertitel mit 60 Zeichen, der zwei Sekunden steht, verlangt 30 Zeichen pro Sekunde - und nebenbei soll man noch das Bild sehen. Das geht nicht, also passiert eines von beidem: Das Video wird pausiert, oder die Untertitel werden zu Rauschen.

Der Referenzwert, auf den sich die Branche weitgehend geeinigt hat, sind 17 Zeichen pro Sekunde für Erwachsenenprogramme - die Zahl aus Netflix’ Timed-Text-Styleguide und die Voreinstellung, gegen die unsere Lesbarkeitsprüfung testet. Kinderinhalte liegen langsamer, meist um 13. Schnelle Dialoge in einer Komödie dürfen für ein paar Cues darüber gehen, aber eine Datei mit einem Schnitt über 20 CPS erschöpft jeden, der wirklich mitliest.

Konkret bedeutet das bei 17 CPS:

Untertitel-LängeMindeststandzeit
30 Zeichen1,8 Sekunden
42 Zeichen2,5 Sekunden
60 Zeichen3,5 Sekunden
84 Zeichen (zwei volle Zeilen)5,0 Sekunden

Maschinell erzeugte Untertitel brechen diese Regel ständig, weil sie an Pausen im Ton schneiden statt daran, wie lange eine Zeile zum Lesen braucht. Wer einen langen Satz in einem Atemzug herausfeuert, produziert ein Cue mit 90 Zeichen und drei Sekunden Standzeit - technisch perfekt synchron, praktisch unlesbar.

42 Zeichen pro Zeile, maximal zwei Zeilen

Die zweite Zahl ist die Zeilenlänge. Jenseits von etwa 42 Zeichen legt das Auge horizontal so viel Weg zurück, dass es den Anfang der nächsten Zeile verliert; auf dem Handy schrumpft der Text oder bricht an hässlicher Stelle um.

Daraus folgt die dritte Zahl: höchstens zwei Zeilen gleichzeitig. Dreizeiler verdecken das Bild und zwingen zur Wahl zwischen Lesen und Zuschauen. Passt ein Satz nicht in zwei Zeilen à 42 Zeichen, ist er kein Untertitel - sondern zwei.

Und wenn getrennt wird, dann an einer grammatischen Fuge. Eine Zeile, die nach „der” oder „und” umbricht, zwingt zum Zwischenspeichern eines halben Gedankens:

Schlecht:                   Besser:
Wir verschieben den         Wir verschieben
Start auf März, weil        den Start auf März

Auf Hochkantvideo zählen zwei Zeilen aus einem zweiten Grund: Ein dreizeiliger Untertitel ist hoch genug, um in den Streifen zu ragen, den die Oberfläche der App selbst verdeckt. Der Safe-Zone-Checker zeichnet diesen Streifen über deinen eigenen Frame.

Die vierte Zahl: nicht blitzen lassen

Ein Untertitel, der in weniger als einer Sekunde auftaucht und verschwindet, wirkt wie ein Flackern - auch wenn die Wörter wirklich so kurz gesprochen wurden. Die übliche Untergrenze im Rundfunk sind fünf Sechstel einer Sekunde (etwa 0,83 s); online ist eine volle Sekunde sicherer. Kurze Einwürfe - „Ja.” „Genau.” - sind genau die, die automatische Werkzeuge zu schnell ausspielen, weil der Ton tatsächlich so kurz ist.

Die Lösung heißt nicht, jedes Cue länger stehen zu lassen, sondern zusammenzufassen. Zwei Ein-Wort-Cues im Abstand von 300 ms sind ein Cue, das anderthalb Sekunden steht.

Warum Auto-Untertitel das systematisch falsch machen

Automatische Untertitelung optimiert auf Synchronität, nicht auf Lesbarkeit. Sie weiß, wann jedes Wort gesprochen wurde, und setzt die Cues an die Wellenform. Das Ergebnis ist perfekt tontreu und dem Lesenden gegenüber gleichgültig:

  • lange, schnell gesprochene Sätze werden zu einem dichten Cue,
  • natürliche Pausen werden zu Cue-Grenzen, auch mitten im Satz,
  • Füllwörter bekommen eigene Mikro-Cues,
  • und nichts wird zusammengefasst, weil nichts die Lesezeit misst.

Deshalb können „das Transkript ist zu 99 % korrekt” und „die Untertitel sind unangenehm” beide über dieselbe Datei wahr sein.

Eine Datei in etwa einer Minute prüfen

Man muss nicht 400 Cues von Hand ansehen. Exportiere die SRT oder VTT, wirf sie in die Lesbarkeitsprüfung, und sie listet jedes Cue auf, das dein CPS-Limit überschreitet, zu lange Zeilen hat, zu viele Zeilen nutzt oder kürzer steht als dein Minimum. Voreingestellt sind 17 CPS, 42 Zeichen, 2 Zeilen - ändere die Werte, wenn deine Plattform eigene Vorgaben hat.

Dann in dieser Reihenfolge reparieren, weil jeder Schritt den nächsten verkleinert:

  1. Flackern zusammenfassen. Cues unter einer Sekunde, die neben ihren Nachbarn liegen.
  2. Dichte Cues teilen. Alles über dem CPS-Limit wird zu zwei Cues mit einem echten Trennpunkt.
  3. Lange Zeilen neu umbrechen. An Satzfugen trennen, nicht am 42. Zeichen.
  4. Erneut prüfen. Eine saubere Datei landet meist bei über 90 % bestandener Cues; die letzten Prozent zu jagen lohnt selten, denn ein paar schnelle Cues bei wirklich schnellem Dialog sind in Ordnung.

Kamen die Untertitel aus einem anderen Werkzeug im falschen Format, wechselt der Untertitel-Konverter zwischen SRT, VTT und reinem Text, ohne die Timings anzufassen.

Was die Zahlen nicht abdecken

Die Standards sagen nichts darüber, was untertitelt wird. Zwei Gewohnheiten bringen mehr Komfort als jede Timing-Regel: Füllwörter („äh”, „weißt du”) weglassen, wenn sie nichts bedeuten, und relevante Geräusche untertiteln - eine Tür, ein Lachen, einsetzende Musik - für alle, die ohne Ton schauen. Beides taucht in keinem CPS-Report auf, und beides ist der Unterschied zwischen regelkonformen und wirklich guten Untertiteln.

Untertitel für Ihr eigenes Video? SRT und VTT in Minuten → 15 Freiminuten · Credits verfallen nie · kein Abo

Weiterlesen

Creator & Medien

Untertitel für Reels und TikTok: die Safe Zone, die niemand veröffentlicht

Keine der beiden Plattformen veröffentlicht eine Safe Zone für organische Posts, die berühmte Ton-aus-Statistik stammt von 2016, und TikTok sagt, seine Nutzer wollen Ton. Was tatsächlich dokumentiert ist und wie Untertitel lesbar werden statt nur vorhanden.

20. Aug. 2026 · 7 Min. Lesezeit
Creator & Medien

Eine Podcast-Folge in Shownotes, Kapitel und Untertitel verwandeln

Ein Upload Ihrer Aufnahme liefert Ihnen ein Transkript, Kapitel mit Zeitmarken, Shownotes und Untertiteldateien – die gesamte Text-Ebene der Postproduktion, in Minuten statt an einem Abend.

4. Juli 2026 · 6 Min. Lesezeit
Genauigkeit & Vertrauen

Clean Verbatim vs. Full Verbatim: was jede Stufe entfernt - und welche davon KI dir wirklich liefert

Full Verbatim behält jedes Ähm, jeden Fehlstart und jedes Husten; Clean Verbatim entfernt, was der Sprecher nicht sagen wollte; editierte Transkripte schreiben um. Wer was braucht, was es in Stunden kostet, und die ehrliche Antwort darauf, was ein KI-Transkript ist.

3. Sept. 2026 · 6 Min. Lesezeit

Mach aus deiner nächsten Aufnahme Text

Audio oder Video hochladen und in Minuten ein sauberes Transkript, Untertitel, eine Zusammenfassung und Übersetzung erhalten.

Erste Datei kostenlos transkribieren → 15 Freiminuten · Credits verfallen nie · kein Abo