Convertir JSON a SRT por segmentos o palabra por palabra.
Para convertir una transcripción en JSON a SRT, pega el contenido o arrastra el archivo .json y haz clic en convertir. Leemos el inicio y el fin de cada segmento en segundos y, cuando el archivo trae tiempo por palabra, armamos subtítulos de hasta 2 líneas con 42 caracteres. El SRT sale numerado y en UTF-8.
Gratis, sin registroSegundo archivo
Por ejemplo, el nombre del video y la versión para aprobar.
Este texto no tiene tiempos. Vamos a crear el subtítulo por el ritmo de lectura: cada línea o frase se vuelve un bloque de hasta 2 líneas.
El JSON trae el tiempo de cada palabra. Cortamos bloques de hasta 2 líneas de 42 caracteres, al final de las frases y en las pausas.
¿Quieres el subtítulo listo directo del video? Nosotros transcribimos y subtitulamos por ti.
Informe del subtítulo
- Subtítulos
- Duración
- Palabras
- CPS promedio
- CPS máximo
- Con alerta
| # | Tiempo | Duración | Texto | Caracteres por línea | CPS | Alertas |
|---|
Cómo pasar el JSON de la transcripción a SRT
- 01
Pega o arrastra el .json
Sirve el JSON que devuelven las herramientas de transcripción con IA y las API de voz a texto, con segmentos de inicio, fin y texto. Reconocemos la estructura solos.
- 02
Elige segmentos o palabras
Si el archivo tiene tiempo por palabra, activa la opción de armar los subtítulos con las palabras. Sin ella, cada segmento se vuelve uno o más subtítulos.
- 03
Revisa el reporte y descarga
Mira la velocidad de lectura y las líneas largas de cada subtítulo, corrige los traslapes si hace falta y descarga el SRT en UTF-8.
Qué pasa del JSON al SRT y qué se queda atrás
El JSON de una transcripción guarda mucho más de lo que un subtítulo necesita. Cada segmento trae el texto, el inicio y el fin en segundos (como 4.3 y 6.1) y varios números técnicos: ids de tokens, probabilidad promedio, probabilidad de que no haya voz, tasa de compresión y la temperatura usada al decodificar. Para el SRT solo importan el tiempo y el texto.
Pasamos los segundos al formato 00:00:04,300, numeramos los subtítulos desde 1 y quitamos el espacio con el que suele empezar cada texto. Los campos técnicos y el idioma detectado quedan fuera, porque el SRT no tiene dónde guardarlos.
| En el JSON | En el SRT |
|---|---|
| start y end en segundos | 00:00:04,300 --> 00:00:06,100 |
| text con espacio al inicio | Texto recortado, en hasta 2 líneas |
| words con tiempo por palabra | Subtítulos armados con las palabras (opcional) |
| tokens, avg_logprob, temperature | Se ignoran |
| no_speech_prob, compression_ratio | Se ignoran |
| language | Se ignora: el SRT no guarda idioma |
Segmentos o palabras: ¿cuál da mejores subtítulos?
Los segmentos están pensados para la transcripción, no para la pantalla. Un segmento puede abarcar decenas de segundos de voz y traer una frase de 200 caracteres en una sola línea. En el modo por segmentos, cortamos el texto en líneas de hasta 42 caracteres y, si no cabe en 2 líneas, dividimos el segmento en varios subtítulos y repartimos el tiempo según la cantidad de texto.
Cuando el JSON trae tiempo por palabra, el resultado mejora con la opción de armar con las palabras. Cada subtítulo termina después de un punto, un signo de interrogación o de exclamación, en una pausa de 0,7 segundos o más, o al llegar a 7 segundos, siempre dentro de 2 líneas de 42 caracteres. Así el texto aparece y desaparece al ritmo de la voz.
JSON
{"start": 4.3, "end": 9.8,
"text": " Abran la Biblia en Juan 3:16. Hoy vamos a hablar de esperanza."}
SRT
1
00:00:04,300 --> 00:00:06,100
Abran la Biblia en Juan 3:16.
2
00:00:06,400 --> 00:00:09,800
Hoy vamos a hablar
de esperanza. Qué archivos JSON de transcripción leemos
Reconocemos la estructura por el contenido, así que no importa el nombre del archivo ni de dónde salió. Los tiempos en segundos y en milisegundos se leen como corresponde en cada caso, y la codificación (UTF-8, UTF-16 o Windows-1252) se detecta al cargar el archivo.
- Una lista segments en la que cada elemento tiene start, end (en segundos) y text: la forma más común en las API de voz a texto.
- Una lista words con el tiempo de cada palabra, en la raíz del archivo, junto a los segmentos.
- Palabras dentro de cada segmento, cuando la herramienta alinea la transcripción palabra por palabra.
- Una lista transcription con los tiempos en milisegundos en offsets, frecuente en herramientas de línea de comandos.
Dónde usar el SRT que sale del JSON
El SRT es el subtítulo que casi cualquier programa acepta: YouTube Studio lo sube directo, Premiere Pro lo abre desde Archivo > Importar, DaVinci Resolve lo trae desde el Media Pool y CapCut lo lee en la sección de subtítulos. Muchas herramientas de transcripción también exportan SRT, pero muchas personas solo tienen el JSON, que viene de una API o de un script, o quieren subtítulos armados palabra por palabra.
Antes de descargar, revisa el reporte. Muestra la duración, los caracteres por línea y la velocidad de lectura de cada subtítulo, y marca lo que pasa de 17 caracteres por segundo, las líneas de más de 42 caracteres y los subtítulos de más de 7 segundos, frecuentes cuando el segmento vino largo. Las transcripciones a veces traen [Música] o (aplausos): la opción de quitar descripciones de sonido lo limpia en la misma conversión.
Más que convertir JSON. Nosotros transcribimos el video y te damos el SRT.
Ver también
Preguntas frecuentes
¿Cómo convierto una transcripción en JSON a SRT?
Pega el contenido del .json o arrastra el archivo, deja SRT como salida y haz clic en convertir. Pasamos los segundos de cada segmento a 00:00:04,300, numeramos los subtítulos y cortamos las líneas en 42 caracteres. Si el archivo trae tiempo por palabra, activa la opción de armar los subtítulos con las palabras.
¿Por qué los subtítulos salen demasiado largos?
Porque los segmentos están pensados para la transcripción y pueden durar decenas de segundos. En el modo por segmentos, dividimos lo que no cabe en 2 líneas y repartimos el tiempo según el texto. Para subtítulos que sigan la voz de cerca, genera el JSON con tiempo por palabra y usa la opción de armar con las palabras.
¿Cómo genero el JSON con tiempo por palabra?
Activa la opción de tiempo por palabra (en inglés, word timestamps) en la herramienta o la API que hizo la transcripción. Las palabras aparecen en una lista words, en la raíz del archivo o dentro de cada segmento. Leemos las dos formas, y la opción de armar los subtítulos con las palabras queda disponible al instante.
¿Qué pasa con avg_logprob, tokens y no_speech_prob?
Se ignoran. Esos campos miden la confianza de la transcripción y sirven para depurar, pero el SRT solo tiene número, tiempo y texto. El idioma detectado también queda fuera. Si quieres usar la confianza para revisar fragmentos dudosos, abre el JSON original en un editor de código antes de convertir.
¿Puedo convertir el mismo JSON a VTT, TXT o CSV?
Sí. El mismo JSON puede salir en SRT, VTT, TXT, SBV, ASS, TTML o CSV: solo elige otro formato de salida antes de descargar. El CSV ayuda a revisar el texto en una hoja de cálculo, y el TXT sin tiempos se vuelve texto corrido para un post, un resumen o la descripción del video.
La transcripción trae [Música] y (aplausos). ¿Se pueden quitar?
Sí. Activa la opción de quitar descripciones de sonido: borramos lo que esté entre corchetes o paréntesis y las líneas con ♪, y los subtítulos que queden vacíos salen del archivo. En la misma conversión también puedes quitar etiquetas de formato y corregir subtítulos traslapados.
Sáltate el JSON: nosotros hacemos el SRT de tu video. Con hablantes y tiempo por palabra.
Sube el video o pega el enlace de YouTube. Nosotros lo transcribimos palabra por palabra, en más de 90 idiomas, y descargas el SRT, el TXT o el PDF sin convertir nada.
Ves el resultado en tu material antes de registrar la tarjeta.