Der Leitfaden zur Live-Untertitelung für Broadcast und Streaming
Wo die Untertitel in Ihre Kette kommen, entscheidet über Format, Verzögerung und Aufwand. Ein verständlicher Leitfaden zu 608, WebVTT und TTML, plus eine wiederverwendbare Checkliste vor der Sendung.
Die meisten Projekte zur Live-Untertitelung beginnen mit der falschen Frage. Teams fragen nach dem Anbieter oder nach dem Format. Die Frage, die alles andere entscheidet, ist einfacher: An welcher Stelle Ihrer Kette kommen die Untertitel zum Video hinzu?
Beantworten Sie diese Frage zuerst, und das Format ergibt sich von selbst. Die Verzögerung wird zu einer Einstellung statt zu einer Überraschung. Niemand muss ein neues Gerät ins Rack schrauben.
Überspringen Sie sie, und Sie stellen erst in der Launch-Woche fest, dass Ihr Packager die Hälfte der Formatierung verwirft oder dass Ihre HLS-Player das 608 nie zu sehen bekommen, das Sie angeblich hatten.
Dieser Leitfaden ist die Referenz, die wir jedem Broadcast- und Streaming-Team vor seinem ersten untertitelten Stream wünschen. Er erklärt, wie sich Cloud-Untertitelung in einen bereits bestehenden Workflow einfügt, was die Formate tatsächlich sind und was Genauigkeit und Verzögerung bestimmt. Zum Schluss gibt es fünf Fragen und eine Checkliste, die Sie vor jeder Sendung wiederverwenden können.
Untertitel kommen an einer von fünf Stellen in Ihre Kette
Jede Live-Kette hat dieselben Stationen: einen Zuspielfeed, einen Transcoder, einen Packager, einen Origin, die Player. SyncWords sitzt an einer von fünf Positionen relativ zu diesen Stationen, und jede Position eröffnet andere Formate.

- Vor dem Transcoder. Ihr Feed erreicht SyncWords über SRT als MPEG-TS, und die Untertitel gehen im selben Transportstrom zurück. Das ist der vollständige Broadcast-Pfad: eingebettetes EIA-608, Teletext (DVB-TXT), DVB-SUB und DVB-TTML, jede Sprache auf einer eigenen, gekennzeichneten PID. Er eignet sich für Playout, Zuspielung und jede Kette, die an einem Multiplexer oder einem Satelliten-Uplink endet.
- Zwischen Transcoder und Packager. Der Transcoder sendet CMAF Ingest (oder das ältere HLS Ingest) an SyncWords. SyncWords fügt eine TTML-Untertitelspur hinzu und gibt den Stream an den Packager weiter. AWS-Teams landen oft hier, zwischen MediaLive und MediaPackage. Der Packager wandelt unser TTML in WebVTT um, daher bleibt nur die Formatierung erhalten, die dieser Packager versteht.
- Nach dem Packager, am Origin. SyncWords liest Ihr bestehendes HLS und schreibt WebVTT-Segmente daneben, ohne Ihre Videosegmente zu kopieren oder neu zu veröffentlichen. Die Player erhalten nahezu die gesamte WebVTT-Spezifikation. Damit ist dies die Position mit den umfangreichsten Möglichkeiten für Formatierung und Platzierung.
- RTMP. Social-Media- und Live-Shopping-Streams haben praktisch keinen Transcoder oder Packager. Die Untertitel reisen mit dem RTMP-Stream zu Zielen wie YouTube Live und Facebook Live.
- Das Widget. Ganz ohne Video. Zuschauer öffnen einen Link oder scannen einen QR-Code und lesen die Untertitel auf ihrem eigenen Smartphone. Das ist das Produkt für Events, und Audio allein genügt.
Zwei Dinge gelten an jeder Position. Das Video wird nie transkodiert, sodass Bildqualität, DRM und SCTE-35-Marker so durchlaufen, wie sie angekommen sind. Und eine Sitzung kann mehrere Positionen gleichzeitig bedienen: SRT zurück an Ihr Playout und ein Widget-Link für die Menschen im Saal, aus denselben Untertiteln.
Sie arbeiten mit AWS? Live-Untertitel für AWS MediaLive ohne Neukodierung führt Schritt für Schritt durch die mittlere Position.
Sie behalten Ihren bestehenden Stack
Cloud-Untertitelung bedeutet nicht, dass Sie etwas herausreißen müssen. Wenn Sie bereits einen Hardware-Caption-Encoder besitzen, kann SyncWords ihn über IP mit einem 608-Feed ansteuern, sodass Sie in Ihrem eigenen Tempo umsteigen. Wenn Ihre Captioner oder Ihre Steno-Software bereits einen 608-Feed erzeugen, können wir ihn über eine direkte Control-A-Verbindung übernehmen und daraus Untertitel erstellen. Und wenn Ihr Team alles automatisiert, können Sie über die API einmalig einen Dienst pro Kanal zuordnen und ihn danach starten, stoppen und planen, ohne die Konfiguration erneut anzufassen.
Untertitelformate verständlich erklärt
Formate gibt es in zwei Familien. Die einen reisen im Videosignal mit. Die anderen werden als separate Text- oder Bildspuren daneben übertragen.
EIA-608. Sie finden es auch unter dem Namen CEA-608: derselbe Standard, der Name folgte dem Normungsgremium. Es ist das nordamerikanische Line-21-Format aus der Zeit des analogen Fernsehens. Ein kleiner Zeichensatz, wenige Textzeilen, vier Untertitelkanäle (CC1 bis CC4). Die meisten US-Playout-Systeme, Decoder und Hardware-Caption-Encoder erwarten dieses Format. Es deckt die sieben Sprachen ab, die der Standard unterstützt, darunter Englisch, Spanisch, Französisch, Portugiesisch und Italienisch.
CEA-708. Der Nachfolger für das digitale Fernsehen, mit mehr Diensten, Schriften, Farben und Fensterplatzierung. Das Detail, über das Teams stolpern: Digitale Untertiteldaten enthalten aus Kompatibilitätsgründen 608, und genau so erreicht SyncWords eine 708-Kette. Wir schreiben EIA-608, und ein System, das 708 erwartet, erhält unser 608 darin eingebettet. CEA-608 vs. 708: Was Broadcast-Teams wissen müssen erklärt, was das für Ihre Decoder bedeutet.
WebVTT. Das Textspurformat des HLS-Streamings. Eine einfache Datei mit zeitgesteuerten Cues, die der Player in seinem eigenen Untertitelmenü auf dem Bildschirm darstellt. Wenn Ihre Zuschauer in einem Browser, einer App oder einem Connected-TV-Player schauen, sehen sie mit ziemlicher Sicherheit dieses Format. JW Player, THEOplayer, HLS.js und Video.js zeigen es alle nativ an.
TTML. Die XML-basierte Timed-Text-Familie. Im Streaming ist es die Untertitelspur innerhalb von CMAF. Sein Broadcast-Profil, DVB-TTML, ist die Richtung, in die sich die europäische Untertitelung bewegt: präzise Positionierung und moderne Formatierung, wobei die Decoder-Unterstützung noch aufholt.
Teletext und DVB-SUB. Die Arbeitspferde des europäischen Rundfunks. Teletext (DVB-TXT) ist mit den bereits in den Haushalten vorhandenen Set-Top-Boxen am breitesten kompatibel, mit einer Seitennummer pro Sprache. DVB-SUB sendet jeden Untertitel als Bitmap, sodass jeder Decoder ihn anzeigen kann, unabhängig von den vorhandenen Schriften. Das macht es zur verlässlichen Wahl für Arabisch, Kyrillisch, Chinesisch, Japanisch und andere nicht-lateinische Schriften.
Die Faustregel: Wählen Sie das Format passend zum letzten Gerät, das es verstehen muss. Eine US-Playout-Kette will 608. Ein HLS-Player will WebVTT. Eine europäische Set-Top-Box will Teletext oder DVB-SUB.
Genauigkeit beginnt bei der Aufnahme
Genauigkeit beginnt bei der Aufnahme. Mit sauberem Programmton und einem individuellen ASR-Wörterbuch für Ihre Namen und Fachbegriffe liefert die Live-Untertitelung erstklassige Wortgenauigkeit. Da jede Übersetzung auf diesem Transkript aufbaut, wirkt sich die Qualität des Wörterbuchs auf jede Untertitel- und Synchronsprache aus.
In der Praxis bedeutet das drei Dinge.
- Senden Sie den Programmton, nicht ein Raummikrofon. Bei einer MPEG-TS-Quelle können Sie die genaue Audiospur per Index oder PID auswählen, sogar einzelne Kanäle darin. Wählen Sie die saubere Kommentar- oder Moderatorenmischung, nicht die Stadionatmosphäre.
- Laden Sie das Wörterbuch vor der Sendung. Namen von Moderatoren, Mannschaftsaufstellungen, Sponsoren, Ortsnamen, Akronyme. Wörterbücher sind unbegrenzt, lassen sich als Standard oder pro Event festlegen und bleiben einem Programmtyp zugeordnet, sodass die Dienstagssendung nicht jede Woche bei null anfängt.
- Entscheiden Sie, wo ein Mensch hingehört. Der Caption Editor zeigt einem Editor die KI-Untertitel eine festgelegte Anzahl von Sekunden, bevor die Zuschauer sie sehen, sodass in diesem Zeitfenster jemand einen Namen korrigieren kann. Für die wichtigsten Sitzungen lässt sich über dieselbe Plattform ein menschlicher CART-Captioner buchen.
Mehr dazu, wo KI- und menschliche Untertitelung jeweils hingehören: Von der traditionellen Live-Untertitelung zur KI-gestützten Barrierefreiheit. Und die üblichen Gründe, warum ein untertiteltes Event schiefgeht, von denen fast keiner technischer Natur ist: Warum die Untertitelung von Live-Events scheitert und wie Sie sicherstellen, dass Ihre gelingt.
Verzögerung ist eine Einstellung, die Sie wählen
Drei Begriffe werden in jedem Gespräch über Untertitelung verwechselt, und sie bedeuten Unterschiedliches.
- Latenz ist, wie weit das ausgehende Video hinter dem eingehenden Video zurückliegt.
- Verarbeitungszeit ist, wie lange die Pipeline braucht, um Sprache in einen Untertitel umzuwandeln.
- Verzögerung ist, was der Zuschauer bemerkt: der Untertitel im Verhältnis zum Ton, den er hört.
Die Stellschraube dazwischen ist der Puffer. Halten Sie das Video einige Sekunden zurück, haben die Untertitel Zeit aufzuholen und erscheinen ohne wahrnehmbare Verzögerung. Halten Sie das Video knapp, nehmen Sie eine kurze Lücke zwischen Sprache und Untertitel in Kauf. Viele Broadcast-Teams entscheiden sich für Letzteres.
Die Werte hängen von der Position ab. Der Videopfad selbst fügt in SRT-Workflows eine halbe Sekunde Latenz hinzu, und ohne Puffer erhalten Sie in SRT eine Untertitelverzögerung von unter 2 Sekunden. Typische Untertitelungslösungen zeigen Live-Untertitel innerhalb von 4 bis 8 Sekunden an. Auf der HLS-Seite sehen Zuschauer in HLS-Workflows die Untertitel typischerweise etwa 5 Sekunden nach dem Programmton.
Übersetzte Untertitel brauchen in der Erstellung länger als Untertitel in der Originalsprache, daher benötigt ein mehrsprachiger Stream einen größeren Puffer. Wir legen ihn gemeinsam mit Ihnen pro Kanal fest. Der Beitrag zu mehrsprachigen Live-Untertiteln behandelt diese Seite.
Ihre Pflichten, unser Output
Sender und öffentliche Einrichtungen untertiteln, weil Vorschriften es verlangen: FCC Title V, der ADA, der European Accessibility Act (seit Juni 2025 in Kraft) und weitere, je nachdem, wo Sie senden. Der Output von SyncWords ist auf die Kriterien von FCC Title V für Genauigkeit, Synchronität, Vollständigkeit und Platzierung ausgelegt und hilft Ihnen, die für Sie geltenden Barrierefreiheitspflichten zu erfüllen. Die Einhaltung selbst liegt in der Verantwortung des Senders; unser Output ist darauf ausgelegt, sie zu unterstützen.
Die Platzierung ist das Kriterium, das Teams vergessen. Bei 608 legen Sie die Zeile und die Anzahl der Zeilen fest. Bei Teletext legen Sie die Zeile fest und können doppelte Höhe verwenden. Bei DVB-SUB, WebVTT und DVB-TTML legen Sie den unteren Rand fest. Nutzen Sie diese Einstellungen, um Untertitel von Bauchbinden und Score-Einblendungen fernzuhalten, und zwar vor der ersten Sendung, nicht nach der ersten Beschwerde.
Fünf Fragen, die Sie vor der Untertitelung eines Livestreams stellen sollten
1. Welches Untertitelformat benötigt jedes Ziel? Listen Sie jedes Ziel auf: Playout, OTT-App, Website-Player, Social Media. Notieren Sie daneben das Format, das jedes Ziel liest. Diese Liste zeigt Ihnen, welche Position Sie brauchen und ob eine Sitzung mehr als ein Ziel bedienen sollte.
2. Wer prüft das individuelle Wörterbuch für Namen und Begriffe? Bestimmen Sie eine verantwortliche Person. Meist ist das der Producer oder die Person, die den Sendeablauf schreibt. Ein Wörterbuch, für das niemand zuständig ist, ist spätestens bei der dritten Sendung veraltet.
3. In welchen Sprachen schaut Ihr Publikum tatsächlich? Schauen Sie auf Ihre Analysedaten, nicht auf Ihre Ambitionen. Beginnen Sie mit den zwei oder drei Sprachen, die die Daten zeigen, und fügen Sie weitere hinzu, sobald Sie sehen, dass sie genutzt werden.
4. Wie erreichen die Untertitel jede Plattform, auf die Sie streamen? Eine Sitzung kann mehrere Ziele gleichzeitig beliefern, und jede Auslieferungsmethode transportiert jede aktive Sprache. Vergewissern Sie sich vor dem Sendetag, nicht erst am Sendetag, dass jede Plattform Untertitel in einem Format erhält, das sie akzeptiert.
5. Wer überwacht die Untertitel während der Sendung? Jemand sollte den Output auf dem echten Player oder Decoder beobachten und eine Möglichkeit haben, den Support zu erreichen. Der Support von SyncWords ist rund um die Uhr erreichbar, und bei Events nimmt ein Live-Techniker an der Sitzung teil.
Die Checkliste vor der Sendung
Drucken Sie sie aus, fügen Sie sie in Ihr Runbook ein und verwenden Sie sie jedes Mal wieder.

Eine Woche vorher
- [ ] Ziele und ihre Formate aufgelistet, Position abgestimmt
- [ ] Sprachen anhand der Publikumsdaten ausgewählt
- [ ] Wörterbuch mit Namen, Begriffen und Akronymen geladen und eine verantwortliche Person benannt
- [ ] Puffer abgestimmt: knappes Video mit kurzer Untertitelverzögerung oder einige Sekunden Puffer ohne wahrnehmbare Verzögerung
- [ ] Dienst erstellt und geplant, sodass er pünktlich startet, ohne dass jemand an der Tastatur sitzt
Am Vortag
- [ ] End-to-End-Test auf dem echten Decoder, Player oder Social-Media-Ziel, nicht in einem Vorschaufenster
- [ ] Platzierung der Untertitel im Verhältnis zu Bauchbinden und Grafiken geprüft
- [ ] Sprachbezeichnungen im Player-Menü oder in der Auswahl der Set-Top-Box geprüft
- [ ] Programmtonspur bestätigt: die saubere Mischung, mit gesundem Pegel
- [ ] Failover-Pfad bestätigt
Während der Sendung
- [ ] Eine Person beobachtet die Untertitel auf dem Output, den die Zuschauer sehen
- [ ] Caption Editor geöffnet, wenn Namen oder Zahlen stimmen müssen
- [ ] Support-Kontakt griffbereit
Nach der Sendung
- [ ] Korrigiertes Transkript und VTT-Datei abgeholt (sie werden automatisch erzeugt, wenn die Sitzung endet)
- [ ] Falsch erkannte Namen für das nächste Mal ins Wörterbuch aufgenommen
Wie es weitergeht
Dieser Leitfaden ist der Ausgangspunkt. Drei Beiträge in diesem Monat gehen tiefer auf die obigen Fragen ein:
- Live-Untertitel für AWS MediaLive ohne Neukodierung, für Teams mit AWS Elemental
- CEA-608 vs. 708: Was Broadcast-Teams wissen müssen, für alle, deren Decoder 708 verlangen
- Ein Live-Feed, viele Sprachen, zum Hinzufügen übersetzter Untertitel zum selben Stream
Zum Transportprotokoll, auf dem die meisten Broadcast-Workflows aufbauen, lesen Sie Secure Reliable Transport (SRT): Das Protokoll hinter Livestreams mit niedriger Latenz.
Möchten Sie Untertitel auf Ihrem eigenen Feed sehen, an der Position, die zu Ihrer Kette passt? Buchen Sie eine Demo: Demo buchen
Sehen Sie Untertitel auf Ihrem eigenen Feed
Demo buchen