Comment l'IA améliore le sous-titrage et la transcription
Dans le domaine du sous-titrage, la reconnaissance vocale s'appuie sur l'intelligence artificielle pour traiter les contenus à grande échelle. Les programmes d'IA sont entraînés à produire des transcriptions de qualité. Cet objectif paraissait hors de portée il y a quelques décennies, mais la technologie est aujourd'hui largement utilisée dans les médias et le divertissement. Comment l'IA contribue-t-elle au sous-titrage, et peut-elle fonctionner efficacement sans intervention humaine ? SyncWords vous explique.
Alors que la Covid se propageait dans le monde, les informations de santé publique devaient être rendues accessibles à grande échelle grâce à la technologie. Les dirigeants et les organismes de santé devaient communiquer les mesures destinées à limiter la propagation du virus. Accessibilité à l'information était alors indispensable. À mesure que les échanges à distance se généralisaient pour maintenir le lien, le sous-titrage vidéo est devenu essentiel.
Dans le domaine du sous-titrage, la reconnaissance vocale utilise l'intelligence artificielle pour traiter le sous-titrage à grande échelle. Elle permet de gagner du temps et de maîtriser les coûts. Les programmes d'IA sont entraînés à produire des transcriptions à partir de la parole. À la différence du travail humain, cette méthode peut être adaptée à de grands volumes, tandis que la sténotypie et la dictée vocale dépendent de la disponibilité de chaque professionnel. La transcription et le sous-titrage humains restent utiles pour les contenus qui nécessitent une révision approfondie, tandis que la reconnaissance automatique de la parole, ou ASR, permet d'industrialiser le processus.
Cette conversion de la parole en texte est rendue possible par l'intelligence artificielle. L'ASR a profondément transformé ces méthodes de production : elle contribue à réduire les coûts et à accélérer le processus. Ce qui semblait hors de portée il y a quelques décennies est aujourd'hui une pratique courante dans les médias et le divertissement.
What is ASR?
Lorsqu'un ingénieur conçoit un programme, il commence par décomposer le processus pour en comprendre chaque élément. La technologie ASR traditionnelle repose sur trois composants. Le premier est un modèle acoustique qui prédit les phonèmes, les plus petites unités de la parole, et qui est entraîné à partir de courts extraits audio. Le deuxième est un lexique ou vocabulaire analysé par l'algorithme avec les données acoustiques. Le troisième est un modèle linguistique qui réunit les deux premiers pour former des séquences de parole reconnaissables par la machine.
En résumé, les machines sont entraînées à reconnaître des structures dans la parole et la langue, puis à analyser ces informations pour produire un texte aussi fidèle que possible.
Limites de l'ASR
L'ASR n'est toutefois pas une technologie parfaite. Ses résultats dépendent de nombreux facteurs, notamment de la qualité audio, de l'accent des locuteurs et des chevauchements de parole. Les répétitions et les formulations redondantes peuvent également entraîner des erreurs. Les hésitations et mots de remplissage, liés aux habitudes linguistiques et au processus de réflexion humain, ne sont pas toujours correctement interprétés par les machines.
Les erreurs les plus fréquentes de l'ASR relèvent des catégories suivantes :
- Punctuation
- Grammar
- Erreurs d'identification des locuteurs, en particulier lorsqu'ils sont plusieurs
- Faux départs et hésitations, comme les « euh », « hum » et autres sons employés dans la conversation.
- Homonyms
- Chevauchements de parole et bruits de fond
- Mauvaise qualité audio
L'ASR rencontre aussi des difficultés lorsqu'un locuteur se corrige au milieu d'une phrase. Un sous-titreur ou transcripteur humain repère ces situations et peut faire preuve de discernement pour restituer le texte dans un format compréhensible qui respecte l'intention du locuteur. La reconnaissance vocale doit encore progresser pour distinguer ces schémas de parole et comprendre le contexte.
Avantages de l'ASR

L'ASR peut néanmoins simplifier le sous-titrage et la transcription lorsque les coûts et les délais doivent être pris en compte. Une méthode efficace consiste à ajouter une étape de révision entre la reconnaissance automatique de la parole et la transcription finale. Comme souvent dans le domaine technologique, les versions successives continuent d'améliorer la qualité des résultats.
Malgré ces limites, l'ASR joue un rôle dans le sous-titrage, notamment pour les vidéos en direct qui ne disposent pas de longs délais de production. Les prestataires de sous-titrage travaillent avec des sous-titreurs humains pour les événements en direct et reconnaissent également l'utilité de l'ASR dans la diffusion vidéo en direct.
L'IA intervient aussi dans le sous-titrage et la transcription par l'intermédiaire de la traduction automatique (TA), devenue incontournable dans le domaine de la localisation. La localisation favorise la mondialisation, et réciproquement. La traduction des sous-titres par IA aide les personnes qui ne parlent pas la langue d'origine à comprendre le contenu plus facilement. Pendant la pandémie, ce service complémentaire pour les événements en direct et en ligne a permis à des participants du monde entier d'interagir avec les contenus. L'IA a ainsi contribué à les rendre plus accessibles et inclusifs.
Comment SyncWords utilise l'IA
L'IA permet de produire des sous-titres à grande échelle et de maîtriser les coûts. L'approche de SyncWords intègre une intervention humaine aux étapes critiques afin d'améliorer la qualité. Pour les contenus à la demande ou préenregistrés, la technologie d'IA de SyncWords synchronise le média avec la transcription. Lorsque celle-ci est réalisée par des professionnels formés, les sous-titres bénéficient d'une formulation et d'un minutage révisés. SyncWords propose aussi des sous-titres issus de transcriptions ASR aux clients qui privilégient une production rapide et économique.
Pour les sous-titres en direct, SyncWords propose des résultats humains ou ASR. Pour les traductions en direct, nous recommandons d'utiliser des sous-titres humains comme langue source, puis de générer par IA des sous-titres traduits dans jusqu'à 163 langues.
Selon Ashish Shah, cofondateur de SyncWords: “SyncWords’ core technologies are powered using its proprietary Machine Learning technology and infrastructure. Using Artificial Intelligence in combination with automation, tools, and human services has reduced the time to generate captions and subtitles from a few days to just a few minutes. This hybrid approach has helped our customers immensely and increased their output and accuracy of captions.”
Wrapping up
L'intelligence artificielle permet de programmer des machines selon de nombreuses règles et de développer les algorithmes utilisés par des technologies comme l'ASR et la traduction automatique. Ces dernières décennies ont vu apparaître des plateformes et services tels que Siri, Alexa, Cortana, les assistants conversationnels et la conversion de la parole en texte de Google. Les résultats de recherche personnalisés et les suggestions de réponse aux courriels simplifient aussi la communication professionnelle. Pour obtenir de meilleurs résultats avec le sous-titrage d'événements en direct ou de vidéos à la demande, il est utile d'associer l'humain et l'IA afin que chaque étape améliore la suivante.
À lire également sur le blog SyncWords
- 5 raisons de sous-titrer vos réunions en direct
- Sous-titrage en direct : 4 bonnes pratiques pour les événements virtuels
- Les origines de SyncWords, l'IA et l'avenir : entretien avec Ashish Shah
- Inclusion et accessibilité dans votre organisation