Saltar al contenido

Convertir JSON a SRT por segmentos o palabra por palabra.

Para convertir una transcripción en JSON a SRT, pega el contenido o arrastra el archivo .json y haz clic en convertir. Leemos el inicio y el fin de cada segmento en segundos y, cuando el archivo trae tiempo por palabra, armamos subtítulos de hasta 2 líneas con 42 caracteres. El SRT sale numerado y en UTF-8.

Gratis, sin registro
Qué hacer
Formato de salida
Limpieza (opcional)

Quita [Música], (risas), líneas con ♪ y nombres en mayúsculas como PASTOR: al inicio de la línea.

Cómo usarla

Cómo pasar el JSON de la transcripción a SRT

  1. 01

    Pega o arrastra el .json

    Sirve el JSON que devuelven las herramientas de transcripción con IA y las API de voz a texto, con segmentos de inicio, fin y texto. Reconocemos la estructura solos.

  2. 02

    Elige segmentos o palabras

    Si el archivo tiene tiempo por palabra, activa la opción de armar los subtítulos con las palabras. Sin ella, cada segmento se vuelve uno o más subtítulos.

  3. 03

    Revisa el reporte y descarga

    Mira la velocidad de lectura y las líneas largas de cada subtítulo, corrige los traslapes si hace falta y descarga el SRT en UTF-8.

Qué pasa del JSON al SRT y qué se queda atrás

El JSON de una transcripción guarda mucho más de lo que un subtítulo necesita. Cada segmento trae el texto, el inicio y el fin en segundos (como 4.3 y 6.1) y varios números técnicos: ids de tokens, probabilidad promedio, probabilidad de que no haya voz, tasa de compresión y la temperatura usada al decodificar. Para el SRT solo importan el tiempo y el texto.

Pasamos los segundos al formato 00:00:04,300, numeramos los subtítulos desde 1 y quitamos el espacio con el que suele empezar cada texto. Los campos técnicos y el idioma detectado quedan fuera, porque el SRT no tiene dónde guardarlos.

En el JSONEn el SRT
start y end en segundos00:00:04,300 --> 00:00:06,100
text con espacio al inicioTexto recortado, en hasta 2 líneas
words con tiempo por palabraSubtítulos armados con las palabras (opcional)
tokens, avg_logprob, temperatureSe ignoran
no_speech_prob, compression_ratioSe ignoran
languageSe ignora: el SRT no guarda idioma

Segmentos o palabras: ¿cuál da mejores subtítulos?

Los segmentos están pensados para la transcripción, no para la pantalla. Un segmento puede abarcar decenas de segundos de voz y traer una frase de 200 caracteres en una sola línea. En el modo por segmentos, cortamos el texto en líneas de hasta 42 caracteres y, si no cabe en 2 líneas, dividimos el segmento en varios subtítulos y repartimos el tiempo según la cantidad de texto.

Cuando el JSON trae tiempo por palabra, el resultado mejora con la opción de armar con las palabras. Cada subtítulo termina después de un punto, un signo de interrogación o de exclamación, en una pausa de 0,7 segundos o más, o al llegar a 7 segundos, siempre dentro de 2 líneas de 42 caracteres. Así el texto aparece y desaparece al ritmo de la voz.

El mismo fragmento como segmento del JSON y como SRT armado con las palabras
JSON
{"start": 4.3, "end": 9.8,
 "text": " Abran la Biblia en Juan 3:16. Hoy vamos a hablar de esperanza."}

SRT
1
00:00:04,300 --> 00:00:06,100
Abran la Biblia en Juan 3:16.

2
00:00:06,400 --> 00:00:09,800
Hoy vamos a hablar
de esperanza.

Qué archivos JSON de transcripción leemos

Reconocemos la estructura por el contenido, así que no importa el nombre del archivo ni de dónde salió. Los tiempos en segundos y en milisegundos se leen como corresponde en cada caso, y la codificación (UTF-8, UTF-16 o Windows-1252) se detecta al cargar el archivo.

  • Una lista segments en la que cada elemento tiene start, end (en segundos) y text: la forma más común en las API de voz a texto.
  • Una lista words con el tiempo de cada palabra, en la raíz del archivo, junto a los segmentos.
  • Palabras dentro de cada segmento, cuando la herramienta alinea la transcripción palabra por palabra.
  • Una lista transcription con los tiempos en milisegundos en offsets, frecuente en herramientas de línea de comandos.

Dónde usar el SRT que sale del JSON

El SRT es el subtítulo que casi cualquier programa acepta: YouTube Studio lo sube directo, Premiere Pro lo abre desde Archivo > Importar, DaVinci Resolve lo trae desde el Media Pool y CapCut lo lee en la sección de subtítulos. Muchas herramientas de transcripción también exportan SRT, pero muchas personas solo tienen el JSON, que viene de una API o de un script, o quieren subtítulos armados palabra por palabra.

Antes de descargar, revisa el reporte. Muestra la duración, los caracteres por línea y la velocidad de lectura de cada subtítulo, y marca lo que pasa de 17 caracteres por segundo, las líneas de más de 42 caracteres y los subtítulos de más de 7 segundos, frecuentes cuando el segmento vino largo. Las transcripciones a veces traen [Música] o (aplausos): la opción de quitar descripciones de sonido lo limpia en la misma conversión.

Preguntas frecuentes

¿Cómo convierto una transcripción en JSON a SRT?

Pega el contenido del .json o arrastra el archivo, deja SRT como salida y haz clic en convertir. Pasamos los segundos de cada segmento a 00:00:04,300, numeramos los subtítulos y cortamos las líneas en 42 caracteres. Si el archivo trae tiempo por palabra, activa la opción de armar los subtítulos con las palabras.

¿Por qué los subtítulos salen demasiado largos?

Porque los segmentos están pensados para la transcripción y pueden durar decenas de segundos. En el modo por segmentos, dividimos lo que no cabe en 2 líneas y repartimos el tiempo según el texto. Para subtítulos que sigan la voz de cerca, genera el JSON con tiempo por palabra y usa la opción de armar con las palabras.

¿Cómo genero el JSON con tiempo por palabra?

Activa la opción de tiempo por palabra (en inglés, word timestamps) en la herramienta o la API que hizo la transcripción. Las palabras aparecen en una lista words, en la raíz del archivo o dentro de cada segmento. Leemos las dos formas, y la opción de armar los subtítulos con las palabras queda disponible al instante.

¿Qué pasa con avg_logprob, tokens y no_speech_prob?

Se ignoran. Esos campos miden la confianza de la transcripción y sirven para depurar, pero el SRT solo tiene número, tiempo y texto. El idioma detectado también queda fuera. Si quieres usar la confianza para revisar fragmentos dudosos, abre el JSON original en un editor de código antes de convertir.

¿Puedo convertir el mismo JSON a VTT, TXT o CSV?

Sí. El mismo JSON puede salir en SRT, VTT, TXT, SBV, ASS, TTML o CSV: solo elige otro formato de salida antes de descargar. El CSV ayuda a revisar el texto en una hoja de cálculo, y el TXT sin tiempos se vuelve texto corrido para un post, un resumen o la descripción del video.

La transcripción trae [Música] y (aplausos). ¿Se pueden quitar?

Sí. Activa la opción de quitar descripciones de sonido: borramos lo que esté entre corchetes o paréntesis y las líneas con ♪, y los subtítulos que queden vacíos salen del archivo. En la misma conversión también puedes quitar etiquetas de formato y corregir subtítulos traslapados.

Sáltate el JSON: nosotros hacemos el SRT de tu video. Con hablantes y tiempo por palabra.

Sube el video o pega el enlace de YouTube. Nosotros lo transcribimos palabra por palabra, en más de 90 idiomas, y descargas el SRT, el TXT o el PDF sin convertir nada.

Ves el resultado en tu material antes de registrar la tarjeta.