SyncWords

Ihre Plattform ist nicht dabei?

“If it accepts video, audio, captions or a web embed, there is probably a clean seam.”

Unternehmen

“Built in New York for live video everywhere.”
Referenz

„Latenz“ umfasst drei verschiedene Fragen

Bei den meisten verwirrenden Diskussionen über Untertitel-Latenzen werden zwei dieser Größen so behandelt, als wären sie eine einzige. Trennt man sie voneinander, stehen die Zahlen nicht mehr im Widerspruch zueinander.

Die drei Größen

Latenz, Verarbeitungszeit, Verzögerung

Video-Latenz

Wie weit das ausgehende Video hinter dem eingehenden Video zurückliegt: die Basis-Latenz des Protokolls plus der jeweils konfigurierte Puffer. Eine Latenz von unter einer Sekunde ist mit jedem Ausgabetyp erreichbar.

Verarbeitungszeit

Wie lange die Pipeline benötigt, um aus dem gesprochenen Wort Untertitel oder eine Sprachsynchronisation zu erstellen: Spracherkennung, dann Übersetzung, dann Sprachsynthese.

Verzögerung

Was der Zuschauer wahrnimmt: der Untertitel im Vergleich zum gehörten Audio. Die Verzögerung ist die Verarbeitungszeit abzüglich der Latenz, mindestens jedoch null.

Der Kompromiss

Der Puffer ist das Steuerungselement

Eine Erhöhung der Latenz verringert die Verzögerung. Das ist das Grundprinzip des Kompromisses, und dieser wird pro Bereitstellung angepasst anstatt fest vorgegeben zu sein.

Kein Puffer

Das Video wird nur mit der Basis-Latenz des Pfades durchgeleitet, und Zuschauer sehen Untertitel einen kurzen Moment nach den gesprochenen Worten: Untertitel-Verzögerung von unter 2 s in SRT und typischerweise etwa 5 Sekunden hinter dem Programm-Audio in HLS-Workflows.

Ein Puffer von wenigen Sekunden

Bei einsprachigen Untertiteln fängt ein Puffer von 3–5 Sekunden die Verarbeitungszeit vollständig ab, sodass die Untertitel ohne wahrnehmbare Verzögerung und synchron zum Audio erscheinen.

Übersetzung und Sprachsynchronisation

Übersetzte Untertitel und synchronisiertes Audio werden in Echtzeit bereitgestellt und benötigen einen größeren Puffer als einfache Untertitel, um synchron zu sein, da die Übersetzung länger dauert als die Transkription. Der Puffer wird für jedes Szenario individuell angepasst, anstatt als fester Pauschalwert angegeben zu werden.

Die Basis-Latenz zählt ebenfalls

Zeit, die auf dem Pfad ohnehin vergeht, wie etwa eine Segmentdauer beim Ingest über CMAF, ist Zeit, in der die Verarbeitung stattfindet. Puffer und Basis-Latenz überschneiden sich, anstatt sich zu summieren, sodass die Gesamtlatenz näher am größeren der beiden Werte liegt.

Pro Pfad

Basis-Latenz nach Bereitstellungspfad

Was jeder Pfad noch vor einem Puffer zum Video hinzufügt und was das für die Untertitel darauf bedeutet. Jeder Stream-Pfad akzeptiert einen zusätzlichen Puffer, außer HLS am Origin im Append-Modus, was weder Verzögerung hinzufügt noch etwas an Ihrem Stream ändert.

SRT / MPEG-TS
Der Videopfad selbst fügt in SRT-Workflows eine halbe Sekunde Latenz hinzu: etwa 0.3 Sekunden Muxing plus jeder SRT-Abschnitt. Untertitel-Einfügung unter einer Sekunde in SRT-Streams, mit einer Untertitel-Verzögerung von unter 2 s; typische Untertitelungslösungen zeigen Live-Untertitel innerhalb von 4 bis 8 Sekunden an.
CMAF-Ingest (DASH-IF)
Ein Segment Basis-Latenz, das ebenfalls dazu beiträgt, die Verarbeitungszeit der Untertitel abzufangen.
HLS am Origin (Append-Modus)
Eine echte Null: Der bestehende Stream wird erweitert, nicht verzögert. Zuschauer sehen Untertitel in HLS-Workflows typischerweise etwa 5 Sekunden hinter dem Programm-Audio, da auf diesem Pfad kein Puffer vorhanden ist, um die Verarbeitung abzufangen.
Widget
Etwa eine Sekunde Basis-Latenz, wobei Untertitel durchgängig vom gesprochenen Wort bis zur Anzeige typischerweise 1–3 Sekunden benötigen.

Häufig gestellte Fragen

Können Untertitel exakt synchron zum Audio erscheinen?

Ja. Konfigurieren Sie einen Puffer von wenigen Sekunden, damit die Videolatenz die Untertitel-Verarbeitungszeit abfängt und die Untertitel ohne wahrnehmbare Verzögerung erscheinen. Viele Kunden entscheiden sich stattdessen für keinen Puffer und akzeptieren eine kurze Untertitel-Verzögerung, in SRT-Workflows typischerweise unter 2 Sekunden. Was die richtige Wahl ist, hängt davon ab, ob Ihr Publikum ein verzögertes Video oder verzögerte Untertitel besser toleriert.

Wie schnell sind Untertitel von SyncWords im Vergleich zu typischen Lösungen?

Untertitel-Einfügung unter einer Sekunde in SRT-Streams und Untertitel-Verzögerung von unter 2 s in SRT, während typische Untertitelungslösungen Live-Untertitel innerhalb von 4 bis 8 Sekunden anzeigen. Im Events-Widget erscheinen Untertitel durchgängig vom gesprochenen Wort bis zur Anzeige typischerweise in 1–3 Sekunden.

Wie hoch ist die Latenz für übersetzte Untertitel und Sprachsynchronisation?

Übersetzte Untertitel und AI-Sprachsynchronisation werden in Echtzeit bereitgestellt. Da Übersetzungen länger dauern als Transkriptionen, erfordert eine synchrone Wiedergabe einen größeren Puffer als normale Untertitel. Die richtige Einstellung hängt von Ihren Sprachen, Qualitätseinstellungen und der Toleranz für Videolatenz ab. Wir stimmen dies gemeinsam mit Ihnen ab, anstatt einen einzelnen Wert zu nennen.

Verlangsamt das Hinzufügen von Untertiteln unser Video?

Nur um die Basis-Latenz des Pfades zuzüglich des von Ihnen gewählten Puffers. Auf dem Pfad SRT fügt das Video selbst eine halbe Sekunde Latenz hinzu; bei HLS am Origin im Append-Modus kommt gar nichts hinzu, da die ursprünglichen Segmente niemals verändert werden. Auf keinem Pfad findet eine Transkodierung statt.

Warum besteht SyncWords auf drei verschiedenen Begriffen?

Weil eine einzelne Angabe zur „Latenz“ gewöhnlich die Antwort auf die falsche Frage ist. Gibt ein Anbieter die Untertitel-Geschwindigkeit an, meint er möglicherweise die Verarbeitungszeit; fragt ein Techniker nach der Latenz, meint er meist den Videopfad; beschwert sich ein Zuschauer, ist die Verzögerung gemeint. Die drei hängen zusammen und der Puffer vermittelt zwischen ihnen, aber es handelt sich um unterschiedliche Größen mit verschiedenen Zahlenwerten.

Stimmen Sie es auf Ihrem eigenen Stream ab

Der richtige Puffer ist eine Entscheidung mit Blick auf Ihr Publikum, keine technische Spezifikation. Führen Sie mit unseren Ingenieuren einen Proof of Concept durch und erleben Sie das Zusammenspiel live auf Ihren eigenen Inhalten.