Wie AI die Erstellung von Untertiteln und Transkriptionen verbessert
In der Welt der Untertitelung nutzt die Spracherkennungstechnologie künstliche Intelligenz, um den Prozess der Untertitel-Erstellung zu skalieren. AI-Programme sind darauf trainiert, hochwertige Transkriptionen zu erstellen. Vor wenigen Jahrzehnten schien dies noch ein unerreichbares Ziel zu sein, doch heute ist es alltäglich und wird in der Medien- und Unterhaltungsbranche auf breiter Front eingesetzt. Wie treibt AI den Untertitelungsprozess an und reicht es aus, AI allein ohne menschliches Eingreifen oder menschliche Zuarbeit zu nutzen? SyncWords erklärt es.
Als Covid weltweit für Verheerung sorgte, mussten Informationen zum öffentlichen Gesundheitswesen mithilfe von Technologie in großem Umfang bereitgestellt werden. Führungsverantwortliche weltweit und Gesundheitsorganisationen mussten Maßnahmen zur Vermeidung der Virusausbreitung bekannt machen. Barrierefreiheit beim Zugang zu Informationen war das Gebot der Stunde. Und da die Welt zunehmend den virtuellen Raum nutzte, um in Verbindung zu bleiben, wurde die Untertitelung von Videos unerlässlich.
In der Welt der Untertitelung nutzt die Spracherkennungstechnologie künstliche Intelligenz, um den Untertitelungsprozess zu skalieren. Sie erfüllt zwei wesentliche Skalierungsanforderungen: Sie spart Zeit und senkt Kosten. AI-Programme sind darauf trainiert, hochwertige Transkriptionen aus gesprochener Sprache zu erstellen. Der Unterschied zur menschlichen Arbeit liegt in der Skalierbarkeit, während Stenografie und Voice Writing von einzelnen Personen abhängen. Obwohl menschliche Transkription und Untertitelung nach wie vor genauer sind als die Automatisierung, treibt die automatische Spracherkennung (Automated Speech Recognition), also ASR, diesen Prozess in großem Maßstab voran.
Diese Umwandlung von Sprache in Text wird durch künstliche Intelligenz (AI) ermöglicht. ASR hat diese Produktionstechniken maßgeblich geprägt. ASR hat die Produktionskosten gesenkt und den Prozess beschleunigt. Dies erschien noch vor wenigen Jahrzehnten als unerreichbares Ziel, doch heute ist es Standard und wird in der Medien- und Unterhaltungsbranche auf breiter Front eingesetzt.
Was ist ASR?
Wann immer Entwickelnde ein Programm erstellen, besteht der erste Schritt darin, den Prozess durch Reverse Engineering auf Komponentenebene zu analysieren. Die traditionelle ASR-Technologie besteht aus drei Komponenten. Erstens gibt es ein akustisches Modell, das Phoneme (die kleinste Spracheinheit) vorhersagt, wobei das Programm mit kurzen Audioeingaben trainiert wird, um diese Phoneme zu erkennen. Zweitens gibt es eine Lexik- oder Wortschatzeingabe, die der Algorithmus zusammen mit der akustischen Komponente verarbeitet. Und drittens gibt es die übergeordnete Sprachkomponente, die beide zusammenführt, um Wörter zu maschinell erkennbaren Sprachmustern aneinanderzureihen.
Kurz gesagt: Maschinen werden trainiert, Muster in Sprache und Text zu erkennen und diese Informationen dann zu verarbeiten, um eine Textausgabe zu erzielen, die menschlichen Ergebnissen so nahe wie möglich kommt.
Grenzen von ASR
Allerdings ist ASR keine perfekte Technologie. Sie ist von vielen Faktoren abhängig, darunter Audioqualität, Akzente der Sprechenden, überlappende Sprache usw. Ein weiterer Aspekt bei der Umwandlung von Sprache in Text, der leider fehleranfällig ist, sind Wiederholungen und redundante Ausdrücke. Füllwörter, die sich im Laufe der Sprachkultur und als Teil des menschlichen Denkprozesses entwickelt haben, werden von Maschinen nicht vollständig erfasst.
Die häufigsten Fehler bei ASR fallen in eine der folgenden Kategorien:
- Zeichensetzung
- Grammatik
- Fehler bei der Sprechererkennung, insbesondere bei mehreren Sprechenden
- Satzabbrüche und Füllwörter: all jene „Ähms“, „Ähs“ und „Hmms“, die wir in Gesprächen verwenden.
- Homonyme
- Überlappende Sprache und Hintergrundgeräusche
- Schlechte Audioqualität
ASR stößt auch in Fällen an Grenzen, in denen sich Sprechende mitten im Satz korrigieren. Dies sind Lücken, die eine menschliche Fachkraft für Untertitelung oder Transkription erkennt und mit eigenem Ermessen nutzt, um den Text in einem verständlichen Format darzustellen, das den Absichten der Sprechenden entspricht. Die Spracherkennungstechnologie hat noch einen gewissen Weg vor sich, um solche Sprachmuster zu erkennen und Kontext zu verstehen.
Vorteile von ASR

Dennoch gehört ASR zu den Technologien, die Untertitelung und Transkription erheblich vereinfachen können, wenn Kosten- und Zeitfaktoren berücksichtigt werden müssen. Eine effektive Lösung für das Problem der Ungenauigkeit besteht darin, eine Bearbeitungsphase zwischen der automatischen Spracherkennung und der anschließenden Transkription einzufügen. Wie bei den meisten Technologien können Sie jedoch davon ausgehen, dass neuere Iterationen dieser Technologie eine noch höhere Genauigkeit bieten werden.
Unabhängig von diesen Einschränkungen spielt ASR eine wichtige Rolle bei der Untertitelung, insbesondere bei Live-Videos, bei denen keine lange Produktionszeit zur Verfügung steht. Anbieter von Untertiteln arbeiten bei Live-Events mit menschlichen Untertitelnden für Live-Events zusammen und schätzen zugleich die Rolle, die ASR bei Live-Videostreams spielen kann.
Eine weitere Rolle, die AI bei der Erstellung von Untertiteln und Transkriptionen einnimmt, betrifft maschinelle Übersetzung (MT), die in der Welt der Lokalisierung das Gebot der Stunde ist. Die Ironie dabei ist, dass Lokalisierung den Weg für die Globalisierung geebnet hat und umgekehrt. Die Übersetzungsfunktion für Untertitel, angetrieben durch AI, eröffnet Nicht-Muttersprachlern sowie Personen ohne Englischkenntnisse den Zugang zu Untertiteln, um Inhalte einfacher und direkter zu verstehen. Während der Pandemie ermöglichte dieser Zusatzdienst für Untertitel bei Live- und Online-Events Teilnehmern weltweit eine Interaktion mit den Inhalten. Der Konsum von Inhalten wurde durch AI barrierefreier und inklusiver.
Wie SyncWords AI nutzt
Während AI die nötige Skalierung und Kosteneffizienz für die Erstellung von Untertiteln bietet, nutzt der einzigartige Ansatz von SyncWords menschliche Zuarbeit in kritischen Projektphasen, um die Genauigkeit zu steigern, was der wesentliche Faktor für die Kundenzufriedenheit ist. Für On-Demand- bzw. vorab aufgezeichnete Untertitel synchronisiert die proprietäre AI-Technologie von SyncWords die Medien hochpräzise mit dem Transkript. Durch die Nutzung von Transkripten, die von geschulten Fachkräften erstellt wurden, liefert SyncWords zeitlich und sprachlich exakte Untertitel. SyncWords bietet zudem Untertitel auf Basis von ASR-Transkripten für Kunden an, die eine schnelle und kostengünstige Erstellung wünschen und mit der Nutzung von ASR-generiertem Text einverstanden sind.
Für Live-Untertitel bietet SyncWords sowohl menschliche als auch ASR-Ergebnisse an. Für Live-Übersetzungen empfehlen wir Kunden jedoch, menschliche Untertitel als Quelle zu nutzen und die Live-Übersetzungen in 163 Zielsprachen mittels AI-Übersetzung durchzuführen.
Wie SyncWords-Mitbegründer Ashish Shah es ausdrückt: „Die Kerntechnologien von SyncWords basieren auf unserer proprietären Machine-Learning-Technologie und -Infrastruktur. Der Einsatz künstlicher Intelligenz in Kombination mit Automatisierung, Tools und menschlicher Zuarbeit hat die Zeit zur Erstellung von Untertiteln von mehreren Tagen auf wenige Minuten reduziert. Dieser hybride Ansatz hat unseren Kunden enorm geholfen und sowohl ihren Output als auch die Genauigkeit der Untertitel gesteigert.“
Fazit
Künstliche Intelligenz hat es möglich gemacht, Maschinen mit vielfältigen Regeln zu programmieren, während Algorithmen für Technologien wie ASR und MT entwickelt werden. In den letzten ein bis zwei Jahrzehnten sind zahlreiche Plattformen und Dienste für künstliche Intelligenz entstanden, etwa Siri, Alexa, Cortana, Chatbots und die Speech-to-Text-Technologie von Google. Hinzu kommen personalisierte Suchergebnisse und automatische Antwortvorschläge für E-Mails (manchmal etwas unheimlich!), die die Geschäftskommunikation vereinfachen. Um die besten Ergebnisse bei der Untertitelung von Live-Events oder On-Demand-Videos zu erzielen, empfiehlt sich die Kombination aus menschlicher Arbeit und AI, um die Genauigkeit der einen Ausgabe zu nutzen, sie in die andere einzuspeisen und so optimale Ergebnisse zu liefern.
Ähnliche Beiträge im SyncWords-Blog
- 5 Gründe, warum Sie Live-Meetings untertiteln sollten
- Live-Untertitelung: Die 4 besten Praktiken für virtuelle Events
- Die Ursprünge von SyncWords, AI und die Zukunft: Ein Interview mit Ashish Shah
- Inklusion und Barrierefreiheit in Ihrer Organisation