Converter JSON para SRT pelos segmentos ou palavra por palavra.
Para converter uma transcrição em JSON para SRT, cole o conteúdo ou arraste o arquivo .json e clique em converter. Lemos os segmentos com início e fim em segundos e, quando o arquivo traz tempo por palavra, montamos legendas de até 2 linhas com 42 caracteres. O SRT sai numerado e em UTF-8.
Grátis, sem cadastroSegundo arquivo
Por exemplo, o nome do vídeo e a versão para aprovação.
Esse texto não tem tempos. Vamos criar a legenda pelo ritmo de leitura: cada linha ou frase vira um bloco de até 2 linhas.
O JSON traz o tempo de cada palavra. Cortamos em blocos de até 2 linhas de 42 caracteres, no fim das frases e nas pausas.
Relatório da legenda
- Legendas
- Duração
- Palavras
- CPS médio
- CPS máximo
- Com alerta
| # | Tempo | Duração | Texto | Caracteres por linha | CPS | Alertas |
|---|
Como transformar o JSON da transcrição em SRT
- 01
Cole ou arraste o .json
Serve o JSON que ferramentas de transcrição com IA e APIs de fala para texto devolvem, com segmentos de início, fim e texto. Reconhecemos a estrutura sozinhos.
- 02
Escolha segmentos ou palavras
Se o arquivo tem tempo por palavra, marque a opção de montar as legendas pelas palavras. Sem ela, cada segmento vira uma ou mais legendas.
- 03
Confira o relatório e baixe
Veja a velocidade de leitura e as linhas longas de cada legenda, corrija sobreposições se precisar e baixe o SRT em UTF-8.
O que sai do JSON e o que fica para trás
O JSON de uma transcrição guarda muito mais do que uma legenda precisa. Cada segmento traz o texto, o início e o fim em segundos (como 4.3 e 6.1) e uma série de números técnicos: ids dos tokens, probabilidade média, chance de não haver fala, taxa de compressão e a temperatura usada na decodificação. Para o SRT, só interessam o tempo e o texto.
Convertemos os segundos para o formato 00:00:04,300, numeramos as legendas a partir de 1 e tiramos o espaço que costuma abrir cada texto. Os campos técnicos e o idioma detectado ficam de fora, porque o SRT não tem onde guardá-los.
| No JSON | No SRT |
|---|---|
| start e end em segundos | 00:00:04,300 --> 00:00:06,100 |
| text com espaço no começo | Texto aparado, em até 2 linhas |
| words com tempo por palavra | Legendas montadas pelas palavras (opcional) |
| tokens, avg_logprob, temperature | Ignorados |
| no_speech_prob, compression_ratio | Ignorados |
| language | Ignorado: o SRT não guarda idioma |
Segmentos ou palavras: qual dá a melhor legenda?
Os segmentos foram feitos para a transcrição, não para a tela. Um segmento pode cobrir dezenas de segundos de fala e trazer uma frase de 200 caracteres numa linha só. No modo por segmentos, quebramos o texto em linhas de até 42 caracteres e, se não couber em 2 linhas, dividimos o segmento em várias legendas, repartindo o tempo na proporção do texto.
Quando o JSON tem tempo por palavra, o resultado fica melhor com a opção de montar pelas palavras. Cada legenda termina depois de um ponto final, de uma interrogação ou de uma exclamação, numa pausa de 0,7 segundo ou mais, ou ao chegar em 7 segundos, sempre dentro de 2 linhas de 42 caracteres. Assim o texto entra e sai da tela junto com a fala.
JSON
{"start": 4.3, "end": 9.8,
"text": " Abram a Bíblia em João 3:16. Hoje a gente vai falar sobre esperança."}
SRT
1
00:00:04,300 --> 00:00:06,100
Abram a Bíblia em João 3:16.
2
00:00:06,400 --> 00:00:09,800
Hoje a gente vai falar
sobre esperança. Quais arquivos JSON de transcrição nós lemos
Reconhecemos a estrutura pelo conteúdo, então não importa o nome do arquivo nem de onde ele veio. Tempos em segundos e em milissegundos são lidos do jeito certo em cada caso, e a codificação (UTF-8, UTF-16 ou Windows-1252) é detectada na leitura.
- Uma lista segments, em que cada item tem start, end (em segundos) e text: o formato mais comum de APIs de fala para texto.
- Uma lista words com o tempo de cada palavra, no topo do arquivo, ao lado dos segmentos.
- Palavras dentro de cada segmento, quando a ferramenta alinha a transcrição palavra por palavra.
- Uma lista transcription com os tempos em milissegundos no campo offsets, comum em ferramentas de linha de comando.
Onde usar o SRT gerado a partir do JSON
O SRT é a legenda que quase todo programa aceita: o YouTube Studio importa direto, o Premiere Pro abre em Arquivo > Importar, o DaVinci Resolve traz pelo Media Pool e o CapCut lê o arquivo na parte de legendas. Muitas ferramentas de transcrição até exportam SRT, mas muita gente só tem o JSON em mãos, vindo de uma API ou de um script, ou quer as legendas montadas palavra por palavra.
Antes de baixar, olhe o relatório. Ele mostra a duração, os caracteres por linha e a velocidade de leitura de cada legenda, e aponta o que passa de 17 caracteres por segundo, linhas com mais de 42 caracteres e legendas com mais de 7 segundos, comuns quando o segmento veio comprido. Transcrições às vezes trazem [Música] ou (aplausos): a opção de remover descrições de som limpa isso na mesma conversão.
Mais que converter JSON. Nós transcrevemos o vídeo e entregamos o SRT.
Veja também
Perguntas frequentes
Como converter uma transcrição em JSON para SRT?
Cole o conteúdo do .json ou arraste o arquivo, deixe SRT como saída e clique em converter. Transformamos os segundos de cada segmento em 00:00:04,300, numeramos as legendas e quebramos as linhas em até 42 caracteres. Se o arquivo tiver tempo por palavra, marque a opção de montar pelas palavras.
Por que as legendas saem longas demais?
Porque os segmentos são pensados para a transcrição e podem durar dezenas de segundos. No modo por segmentos, dividimos o que não cabe em 2 linhas e repartimos o tempo pelo texto. Para legendas que acompanham a fala de perto, gere o JSON com tempo por palavra e use a opção de montar pelas palavras.
Como gerar o JSON com tempo por palavra?
Ative a opção de tempo por palavra (em inglês, word timestamps) na ferramenta ou na API que fez a transcrição. As palavras aparecem numa lista words, no topo do arquivo ou dentro de cada segmento. Lemos os dois jeitos, e a opção de montar as legendas pelas palavras fica disponível na hora.
O que acontece com avg_logprob, tokens e no_speech_prob?
São ignorados. Esses campos medem a confiança da transcrição e servem para depurar, mas o SRT só tem número, tempo e texto. O idioma detectado também fica de fora. Se quiser usar a confiança para revisar trechos duvidosos, abra o JSON original num editor de código antes de converter.
Dá para converter o mesmo JSON em VTT, TXT ou CSV?
Dá. O mesmo JSON pode sair em SRT, VTT, TXT, SBV, ASS, TTML ou CSV: basta escolher outro formato de saída antes de baixar. O CSV ajuda a revisar o texto numa planilha, e o TXT sem minutagem vira texto corrido para um post, um resumo ou a descrição do vídeo.
A transcrição tem [Música] e (aplausos). Dá para tirar?
Dá. Marque a opção de remover descrições de som: apagamos o que estiver entre colchetes ou parênteses e as linhas com ♪, e as legendas que ficarem vazias saem do arquivo. Na mesma conversão, você também pode remover tags de formatação e corrigir legendas sobrepostas.
Pule o JSON: nós geramos o SRT do seu vídeo. Com falantes e tempo por palavra.
Envie o vídeo ou o link do YouTube. Nós transcrevemos palavra por palavra, em mais de 90 idiomas, e você baixa o SRT, o TXT ou o PDF sem converter nada.
Veja o resultado no seu material antes de cadastrar o cartão.