Saltar al contenido

Convertir VTT a TXT solo lo que se dice, sin encabezado ni tiempos.

Para convertir VTT a TXT, pega el contenido del archivo .vtt o arrastra el archivo y haz clic en convertir. Quitamos la línea WEBVTT, los bloques NOTE y STYLE, los tiempos, los ajustes de posición y las etiquetas de voz, y te entregamos solo el texto hablado en UTF-8, con o sin el tiempo al inicio de cada línea.

Gratis, sin registro
Qué hacer
Formato de salida
Limpieza (opcional)

Quita [Música], (risas), líneas con ♪ y nombres en mayúsculas como PASTOR: al inicio de la línea.

Cómo usarla

Cómo convertir VTT a TXT

  1. 01

    Carga el .vtt

    Arrastra el archivo que descargaste de YouTube Studio, de Vimeo, de una reunión grabada o de una plataforma de cursos, o pega el contenido. Los tiempos sin hora, como 01:12.480, también se leen.

  2. 02

    Elige líneas o párrafos

    Un subtítulo por línea, con [00:01:12] al inicio si quieres, o párrafos que empiezan de nuevo en cada pausa de 2 segundos o más.

  3. 03

    Copia o descarga el .txt

    El texto sale en UTF-8, listo para Word o Google Docs. El informe muestra cuántos subtítulos y palabras tenía el archivo.

¿Qué hay dentro de un archivo VTT además del texto?

WebVTT se creó para los reproductores web, por eso lleva más cosas que un SRT. Arriba va la línea WEBVTT, a veces seguida de metadatos como Kind: captions y Language: es. Entre los subtítulos pueden aparecer bloques NOTE con comentarios de quien revisó, bloques STYLE con reglas de CSS y bloques REGION que definen zonas de la pantalla.

Cada subtítulo también puede tener un identificador en la línea de arriba y ajustes después del tiempo, como line:85% o align:start, que le dicen al reproductor dónde dibujar el texto. Nada de eso es habla. Al convertir, leemos solo los bloques que tienen tiempo, ignoramos el resto y unimos las líneas de cada subtítulo en una sola frase.

Un .vtt con encabezado, nota y ajustes, y el TXT que sale de él
clase-07.vtt
WEBVTT
Kind: captions
Language: es

NOTE revisado el 12/03

clase-07-01
00:01:12.480 --> 00:01:15.020 line:85% align:center
<v Profesora>¿Se acuerdan de la clase pasada?</v>

00:01:15.300 --> 00:01:18.000
Abran el material
en la página 42.

clase-07.txt
¿Se acuerdan de la clase pasada?
Abran el material en la página 42.

¿El nombre de quien habla queda en el TXT?

Depende de cómo se escribió el nombre en el VTT. Algunos sistemas marcan al hablante con la etiqueta de voz, como <v Ana Souza>, que es una marca del formato y no texto del subtítulo. Las transcripciones que se descargan de Microsoft Teams suelen venir así. Al convertir, eliminamos la etiqueta completa, con el nombre adentro, y el TXT queda solo con lo que se dijo.

Otros escriben el nombre dentro del propio texto, como Ana Souza: buenos días. Es lo habitual en las transcripciones de grabaciones de Zoom. Ahí el nombre es texto como cualquier otro y se queda en el TXT. Un detalle: la opción de quitar descripciones de sonido también quita nombres en mayúsculas seguidos de dos puntos, como ANA:, al inicio de la línea. Déjala desactivada si quieres conservar esos nombres.

En el VTTEn el TXT
<v Ana>Buenos días a todos.</v>Buenos días a todos.
Ana: Buenos días a todos.Ana: Buenos días a todos.
ANA: Buenos días, con quitar sonidos activadoBuenos días
<i>Música de entrada</i>Música de entrada
&amp; y &lt;& y <

De dónde salen los archivos VTT que se pasan a texto

Casi siempre de algo que se transmitió o se grabó en la web. VTT es el formato que usan los reproductores de sitios, las plataformas de cursos y las herramientas de reuniones para guardar subtítulos y transcripciones, por eso mucha gente termina con un .vtt cuando lo que quería era un texto para leer.

  • Subtítulos descargados de YouTube Studio o de Vimeo, para hacer un post, un resumen o la descripción
  • La transcripción de una reunión grabada, para redactar el acta o la lista de acuerdos
  • Subtítulos de una clase en una plataforma de cursos, para estudiar con el texto al lado
  • Un webinar o una transmisión en vivo con subtítulos, para sacar citas y preguntas del público
  • Subtítulos de un video institucional, para revisar el texto con el cliente en un documento

Tiempos sin hora, acentos rotos y líneas repetidas

En VTT la hora es opcional: 01:12.480 y 00:01:12.480 son el mismo momento. Leemos las dos formas, y los tiempos del TXT siempre salen completos, en horas, minutos y segundos. La codificación también se detecta sola: UTF-8, UTF-16 o, si el archivo no es UTF-8 válido, Windows-1252. El texto sale en UTF-8, con las tildes y la ñ correctas.

Algunos subtítulos automáticos que van subiendo en pantalla repiten cada línea en dos bloques seguidos para lograr ese efecto. El convertidor entrega lo que hay en el archivo y no une líneas repetidas, así que esas repeticiones aparecen en el TXT. Si es tu caso, borra las duplicadas al revisar o empieza desde la grabación, que nosotros transcribimos sin repeticiones.

Preguntas frecuentes

¿Cómo convertir VTT a TXT?

Pega el contenido del .vtt o arrastra el archivo, deja TXT como salida y haz clic en convertir. El texto aparece en la vista previa para copiarlo, y el botón descarga el .txt en UTF-8. Es gratis y sin registro.

¿La línea WEBVTT y los bloques NOTE aparecen en el texto?

No. El encabezado, los metadatos como Kind y Language, los bloques NOTE, STYLE y REGION, los identificadores de cada subtítulo y los ajustes de posición quedan fuera. En el TXT entra solo lo que se mostraría en pantalla como habla.

¿Por qué desapareció el nombre de quien habla en el TXT?

Porque tu VTT tenía el nombre dentro de la etiqueta de voz, como <v Ana>, que es una marca y se elimina al convertir. Si el nombre estuviera escrito en el texto, como Ana: buenos días, se quedaría. Para tener los hablantes separados a partir de la grabación, la transcripción de FilmScribe marca quién habló en cada fragmento.

¿Puedo mantener los tiempos en el TXT?

Sí. Activa la opción de mantener los tiempos y cada línea empieza con el inicio del subtítulo, en el formato [00:01:12], sin milisegundos. Con párrafos activados, el tiempo aparece solo al inicio de cada párrafo.

El TXT salió con líneas repetidas. ¿Por qué?

Lo más probable es que tu VTT repita las líneas a propósito, como hacen algunos subtítulos automáticos que van subiendo en pantalla. El convertidor no une repeticiones, para no borrar una frase que de verdad se dijo dos veces. Elimina las duplicadas al revisar.

¿Funciona con la transcripción VTT de Zoom o de Teams?

Sí. Los dos entregan la transcripción en .vtt con tiempos, y el convertidor la lee como cualquier otro WebVTT. La diferencia está en el nombre de quien habla: escrito en la línea, se queda; dentro de la etiqueta de voz, se elimina.

¿Tienes la grabación y no solo el VTT? Nosotros la transcribimos con hablantes.

Sube el video o el audio, o pega el enlace de YouTube. Transcribimos cada intervención con quién habló y el tiempo, y descargas en TXT, PDF o SRT.

Ves el resultado en tu material antes de registrar la tarjeta.