O guia da legendagem em direto para televisão e streaming
O ponto em que as legendas entram na sua cadeia decide o formato, o atraso e o trabalho. Um guia simples sobre 608, WebVTT e TTML, com uma checklist reutilizável antes da emissão.
A maioria dos projetos de legendagem em direto começa com a pergunta errada. As equipas perguntam qual o fornecedor, ou qual o formato. A pergunta que decide tudo o resto é mais simples: em que ponto da sua cadeia é que as legendas se juntam ao vídeo?
Responda a isso primeiro e o formato escolhe-se sozinho. O atraso passa a ser uma definição em vez de uma surpresa. Ninguém tem de instalar um novo equipamento no rack.
Salte esse passo e é na semana de lançamento que descobre que o seu packager descarta metade da formatação, ou que os seus leitores HLS nunca veem o 608 que lhe disseram que tinha.
Este guia é a referência que gostaríamos que todas as equipas de televisão e streaming tivessem antes da primeira emissão legendada. Explica como a legendagem na cloud se encaixa num fluxo de trabalho que já opera, o que são realmente os formatos, o que determina a precisão e o atraso, e termina com cinco perguntas e uma checklist que pode reutilizar antes de cada emissão.
As legendas entram na sua cadeia num de cinco pontos
Todas as cadeias em direto têm os mesmos marcos: um sinal de contribuição, um transcodificador, um packager, uma origem, os leitores. A SyncWords posiciona-se num de cinco pontos em relação a eles, e cada posição abre um conjunto diferente de formatos.

- Antes do transcodificador. O seu sinal chega à SyncWords via SRT como MPEG-TS, e as legendas regressam no mesmo transport stream. Este é o caminho completo de difusão: EIA-608 incorporado, Teletext (DVB-TXT), DVB-SUB e DVB-TTML, cada língua no seu próprio PID identificado. Adequa-se a playout, contribuição e qualquer cadeia que termine num multiplexador ou num uplink de satélite.
- Entre o transcodificador e o packager. O transcodificador envia CMAF Ingest (ou o mais antigo HLS Ingest) para a SyncWords, que adiciona uma faixa de legendas TTML e passa o stream ao packager. As equipas que trabalham em AWS ficam muitas vezes aqui, entre o MediaLive e o MediaPackage. O packager converte o nosso TTML em WebVTT, pelo que só sobrevive a formatação que esse packager compreende.
- Depois do packager, na origem. A SyncWords lê o seu HLS existente e escreve segmentos WebVTT ao lado dele, sem copiar nem republicar os seus segmentos de vídeo. Os leitores recebem quase toda a especificação WebVTT, o que faz desta a posição com a formatação e o posicionamento mais ricos.
- RTMP. Os streams para redes sociais e de live shopping praticamente não têm transcodificador nem packager. As legendas viajam com o stream RTMP para destinos como o YouTube Live e o Facebook Live.
- O widget. Nenhum vídeo. Os espetadores abrem uma ligação ou leem um código QR e veem as legendas no próprio telemóvel. Este é o produto para eventos, e basta o áudio.
Há duas coisas que se mantêm em todas as posições. O vídeo nunca é transcodificado, pelo que a qualidade de imagem, o DRM e os marcadores SCTE-35 passam tal como chegaram. E uma sessão pode alimentar várias posições ao mesmo tempo: SRT de volta para o seu playout e uma ligação para o widget destinada às pessoas na sala, a partir das mesmas legendas.
Trabalha em AWS? Como adicionar legendas em direto ao AWS MediaLive sem nova codificação percorre a posição intermédia passo a passo.
Mantém a infraestrutura que já tem
Legendagem na cloud não significa desmontar nada. Se já tem um codificador de legendas em hardware, a SyncWords pode controlá-lo via IP com um sinal 608, para que avance ao seu próprio ritmo. Se os seus legendadores ou o seu software de estenotipia já produzem um sinal 608, podemos recebê-lo através de uma ligação Control-A direta e criar legendas a partir dele. E se a sua equipa automatiza tudo, a API permite associar um serviço a cada canal uma única vez e, depois, iniciá-lo, pará-lo e agendá-lo sem voltar a mexer na configuração.
Formatos de legendas em linguagem simples
Os formatos dividem-se em duas famílias. Uns viajam dentro do sinal de vídeo. Outros viajam como faixas de texto ou de imagem separadas, ao lado dele.
EIA-608. Também o verá designado por CEA-608: é a mesma norma, o nome acompanhou o organismo de normalização. É o formato norte-americano da linha 21, nascido na televisão analógica. Um conjunto de caracteres reduzido, algumas linhas de texto, quatro canais de legendas (CC1 a CC4). É o que a maioria dos sistemas de playout, descodificadores e codificadores de legendas em hardware dos EUA espera. Abrange as sete línguas que a norma suporta, incluindo inglês, espanhol, francês, português e italiano.
CEA-708. O sucessor para televisão digital, com mais serviços, tipos de letra, cores e posicionamento de janelas. O pormenor que apanha as equipas desprevenidas: os dados de legendas digitais transportam 608 no seu interior por razões de compatibilidade, e é assim que a SyncWords chega a uma cadeia 708. Escrevemos EIA-608, e um sistema que espera 708 recebe o nosso 608 dentro dele. CEA-608 vs 708: o que as equipas de televisão precisam de saber explica o que isso significa para os seus descodificadores.
WebVTT. O formato de faixa de texto do streaming HLS. Um ficheiro simples de cues temporizados que o leitor desenha no ecrã, no seu próprio menu de legendas. Se os seus espetadores assistem num browser, numa aplicação ou num leitor de smart TV, é quase de certeza isto que veem. O JW Player, o THEOplayer, o HLS.js e o Video.js apresentam-no de forma nativa.
TTML. A família XML de texto temporizado. No streaming, é a faixa de legendas dentro do CMAF. O seu perfil de difusão, DVB-TTML, é o caminho que a legendagem europeia está a seguir: posicionamento preciso e formatação moderna, embora o suporte dos descodificadores ainda esteja a recuperar terreno.
Teletext e DVB-SUB. Os cavalos de batalha da difusão europeia. O Teletext (DVB-TXT) é o mais amplamente compatível com as set-top boxes que já estão nas casas, com um número de página por língua. O DVB-SUB envia cada legenda como um bitmap, para que qualquer descodificador a possa mostrar, independentemente dos tipos de letra que tenha. Isso torna-o a escolha fiável para árabe, cirílico, chinês, japonês e outras escritas não latinas.
A regra de ouro: escolha o formato em função do último dispositivo que o tem de compreender. Uma cadeia de playout dos EUA quer 608. Um leitor HLS quer WebVTT. Uma set-top box europeia quer Teletext ou DVB-SUB.
A precisão começa na ingestão
A precisão começa na ingestão. Com um áudio de programa limpo e um dicionário ASR personalizado com os seus nomes e terminologia, a legendagem em direto oferece uma precisão de palavras de referência no setor. Como cada tradução é criada a partir dessa transcrição, a qualidade do dicionário reflete-se em todas as línguas de legendas e de dobragem.
Na prática, isso significa três coisas.
- Envie o áudio de programa, não um microfone de sala. Numa fonte MPEG-TS, pode escolher a faixa de áudio exata por índice ou PID, e até canais específicos dentro dela. Escolha a mistura limpa do comentário ou do apresentador, não o som ambiente do estádio.
- Carregue o dicionário antes da emissão. Nomes de apresentadores, plantéis das equipas, patrocinadores, topónimos, siglas. Os dicionários são ilimitados, podem ser definidos como predefinição ou por evento, e ficam associados a um tipo de programação, para que o programa de terça-feira não comece do zero todas as semanas.
- Decida onde entra uma pessoa. O Caption Editor mostra as legendas de IA a um editor um número definido de segundos antes de os espetadores as verem, para que alguém possa corrigir um nome nesse intervalo. Para as sessões mais importantes, é possível reservar um legendador CART humano através da mesma plataforma.
Mais sobre onde se encaixam a legendagem por IA e a legendagem humana: Da legendagem em direto tradicional à acessibilidade com IA. E as razões habituais pelas quais um evento legendado corre mal, quase nenhuma delas técnica: Porque falha a legendagem de eventos em direto e como garantir que a sua não falha.
O atraso é uma definição que escolhe
Há três palavras que se confundem em todas as conversas sobre legendagem, e significam coisas diferentes.
- Latência é o quanto o vídeo de saída vai atrás do vídeo de entrada.
- Tempo de processamento é quanto tempo o pipeline demora a transformar a fala numa legenda.
- Atraso é o que o espetador nota: a legenda em relação ao áudio que está a ouvir.
O controlo entre eles é o buffer. Atrase o vídeo alguns segundos e as legendas têm tempo para o alcançar, pelo que surgem sem atraso percetível. Mantenha o vídeo justo e aceite um pequeno intervalo entre a fala e a legenda. Muitas equipas de televisão escolhem a segunda opção.
Os números dependem da posição. O próprio caminho do vídeo acrescenta meio segundo de latência nos fluxos de trabalho SRT e, sem buffer, obtém um atraso das legendas inferior a 2 s em SRT. As soluções de legendagem típicas apresentam as legendas em direto em 4 a 8 segundos. Do lado do HLS, os espetadores veem normalmente as legendas cerca de 5 segundos atrás do áudio do programa nos fluxos de trabalho HLS.
As legendas traduzidas demoram mais a produzir do que as legendas na língua de origem, pelo que um stream multilingue precisa de um buffer maior. Dimensionamo-lo consigo, canal a canal. O artigo sobre legendas multilingues em direto aborda esse lado.
As suas obrigações, o nosso resultado
As emissoras e os organismos públicos legendam porque as regras o exigem: FCC Title V, a ADA, o EU Accessibility Act (em vigor desde junho de 2025) e outras, consoante o local onde emite. O resultado da SyncWords é construído segundo os critérios do FCC Title V de precisão, sincronia, integralidade e posicionamento, e ajuda-o a cumprir as obrigações de acessibilidade que se aplicam a si. O cumprimento em si é da responsabilidade da emissora; o nosso resultado foi construído para o apoiar.
O posicionamento é o critério que as equipas esquecem. Em 608, define a linha e o número de linhas. Em Teletext, define a linha e pode usar altura dupla. Em DVB-SUB, WebVTT e DVB-TTML, define a margem inferior. Use esses controlos para manter as legendas afastadas dos oráculos e dos marcadores de resultado antes da primeira emissão, e não depois da primeira reclamação.
Cinco perguntas a fazer antes de legendar um stream em direto
1. De que formato de legendas precisa cada destino? Liste todos os destinos: playout, aplicação OTT, leitor do site, redes sociais. Escreva ao lado de cada um o formato que lê. Essa lista diz-lhe de que posição precisa e se uma sessão deve alimentar mais do que uma.
2. Quem verifica o dicionário personalizado de nomes e termos? Atribua-lhe um responsável. Normalmente, o produtor ou a pessoa que escreve o alinhamento. Um dicionário sem responsável fica desatualizado ao terceiro programa.
3. Em que línguas é que a sua audiência assiste de facto? Olhe para os seus dados de audiência, não para as suas ambições. Comece com as duas ou três línguas que os dados mostram e acrescente mais quando as vir a ser utilizadas.
4. Como é que as legendas vão chegar a todas as plataformas para onde transmite? Uma sessão pode entregar em vários sítios ao mesmo tempo, e cada método de entrega transporta todas as línguas ativas. Confirme que cada plataforma recebe legendas num formato que aceita antes do dia, e não no próprio dia.
5. Quem monitoriza as legendas durante a emissão? Alguém deve estar a acompanhar o resultado no leitor ou descodificador real, com forma de contactar o suporte. O suporte da SyncWords funciona 24/7 e, nos eventos, um técnico junta-se à sessão em direto.
A checklist antes da emissão
Imprima-a, cole-a no seu runbook e reutilize-a sempre.

Uma semana antes
- [ ] Destinos e respetivos formatos listados, posição acordada
- [ ] Línguas escolhidas com base nos dados de audiência
- [ ] Dicionário carregado com nomes, termos e siglas, e um responsável designado
- [ ] Buffer acordado: vídeo justo com um pequeno atraso das legendas, ou alguns segundos de buffer e nenhum atraso percetível
- [ ] Serviço criado e agendado, para que arranque a horas sem ninguém ao teclado
Na véspera
- [ ] Teste de ponta a ponta no descodificador, leitor ou destino de rede social real, não numa janela de pré-visualização
- [ ] Posicionamento das legendas verificado em relação aos oráculos e aos grafismos
- [ ] Etiquetas de língua verificadas no menu do leitor ou no seletor da set-top box
- [ ] Faixa de áudio de programa confirmada: a mistura limpa, com um nível adequado
- [ ] Caminho de failover confirmado
No ar
- [ ] Uma pessoa a acompanhar as legendas no resultado que o espetador vê
- [ ] Caption Editor aberto se os nomes ou os números tiverem de estar corretos
- [ ] Contacto do suporte à mão
Depois da emissão
- [ ] Transcrição corrigida e ficheiro VTT recolhidos (são gerados automaticamente quando a sessão termina)
- [ ] Nomes mal reconhecidos acrescentados ao dicionário para a próxima vez
Para onde ir a seguir
Este guia é o ponto de partida. Três artigos deste mês aprofundam as perguntas acima:
- Como adicionar legendas em direto ao AWS MediaLive sem nova codificação, para equipas que usam AWS Elemental
- CEA-608 vs 708: o que as equipas de televisão precisam de saber, para quem tem descodificadores que pedem 708
- Um sinal em direto, muitas línguas, para adicionar legendas traduzidas ao mesmo stream
Para o transporte que está por baixo da maioria dos fluxos de trabalho de televisão, consulte Secure Reliable Transport (SRT): o protocolo por trás dos streams em direto de baixa latência.
Quer ver legendas no seu próprio sinal, na posição que se adequa à sua cadeia? Marque uma demonstração: marcar uma demonstração
Veja legendas no seu próprio sinal
Marcar demonstração