Extractor de Texto de Archivo SRT (Subtítulos)
Convierte un archivo de subtítulos SRT o VTT en una transcripción limpia y legible. La herramienta descarta los números de índice y las marcas de tiempo, quita las etiquetas de formato y las descripciones de sonido, une las frases que quedaron partidas entre subtítulos y elimina las líneas repetidas de los subtítulos automáticos.
- 🎬 Resumen rápido: ¿cómo saco el texto de un SRT?
- Qué es un archivo SRT y qué contiene además del diálogo
- Qué limpia la herramienta
- El problema de las frases partidas
- Formatos de salida
- Casos de uso
- Subtítulos automáticos y líneas repetidas
- Estadísticas que ofrece
- Privacidad y rendimiento
- Herramientas relacionadas en porcentaje.net
- Preguntas Frecuentes (FAQ)
🎬 Resumen rápido: ¿cómo saco el texto de un SRT?
Abre el archivo .srt con cualquier editor de texto, copia todo su contenido y pégalo en la herramienta. Elige el formato de salida (párrafos, un renglón por subtítulo o texto corrido) y copia la transcripción. Si además quieres corregir el cronometraje del archivo, usa el limpiador de tiempos en subtítulos SRT.
Qué es un archivo SRT y qué contiene además del diálogo
Un archivo SRT (SubRip Subtitle) es un fichero de texto plano que acompaña a un vídeo para mostrar los subtítulos sincronizados. Cada subtítulo, llamado cue, se compone de tres partes: un número de orden, un intervalo de tiempo con el formato 00:01:23,456 --> 00:01:26,789 y una o dos líneas de texto. Los archivos WebVTT (.vtt), usados en los vídeos HTML5, tienen una estructura casi idéntica pero con un punto en lugar de la coma en los milisegundos y una cabecera WEBVTT.
Cuando lo que quieres es el contenido —para leerlo, citarlo, traducirlo, indexarlo o convertirlo en un artículo— toda esa información de sincronización es ruido. Copiar y borrar los tiempos a mano en un archivo de 800 subtítulos es inviable; esta herramienta lo hace en una fracción de segundo.
Qué limpia la herramienta
| Elemento | Tratamiento |
|---|---|
| Números de índice | Se eliminan siempre |
| Marcas de tiempo y ajustes de posición | Se eliminan siempre |
Cabecera WEBVTT, NOTE, STYLE | Se descartan |
Etiquetas <i>, <b>, <font>, {\an8} | Opcional (activado por defecto) |
Descripciones de sonido [música], (risas), ♪ | Opcional (activado por defecto) |
| Líneas repetidas consecutivas | Opcional (activado por defecto) |
Guiones de diálogo - | Se mantienen, se quitan o se agrupan por personaje |
El problema de las frases partidas
Un subtítulo suele durar entre uno y seis segundos y ocupar como máximo dos líneas de unos 42 caracteres. Por eso las frases largas se reparten entre varios cues:
14 00:01:02,100 --> 00:01:04,800 Cuando llegué a la estación 15 00:01:04,900 --> 00:01:07,600 ya se había marchado el último tren.
Si simplemente quitas los tiempos, obtienes dos fragmentos sueltos. La opción «Unir frases partidas entre subtítulos» detecta que el primer cue no termina en un signo de puntuación de cierre y lo une con el siguiente, devolviendo «Cuando llegué a la estación ya se había marchado el último tren.» como una sola oración.
Formatos de salida
- Párrafos: reconstruye el texto uniendo las frases partidas y lo agrupa en párrafos de unas tres oraciones. Si detecta diálogo (líneas que empiezan por guion), respeta un renglón por intervención. Es el formato ideal para leer o publicar.
- Un renglón por subtítulo: cada cue se convierte en una línea. Útil para revisar la traducción línea a línea o para volver a temporizar después.
- Texto corrido: todo el diálogo en un único bloque continuo. Perfecto para contar palabras o alimentar otra herramienta.
- Mantener los saltos originales: conserva la división en líneas tal como estaba en el archivo, solo sin números ni tiempos.
Casos de uso
- Crear un artículo o entrada de blog a partir de un vídeo o pódcast subtitulado.
- Traducir subtítulos con más contexto trabajando sobre el texto corrido en lugar de fragmentos.
- Estudiar un idioma leyendo la transcripción completa de una serie o película.
- Documentar reuniones y conferencias cuyo vídeo tiene subtítulos automáticos.
- Análisis de contenido y SEO: extraer las palabras clave y la densidad temática de un vídeo. Puedes seguir con el analizador de densidad de palabras clave o el generador de resumen automático.
- Accesibilidad: ofrecer una transcripción en texto junto al vídeo.
Subtítulos automáticos y líneas repetidas
Los subtítulos generados por reconocimiento de voz (los de YouTube, por ejemplo) usan una técnica de «ventana deslizante»: cada cue repite parte del anterior y añade unas palabras nuevas. El resultado, sin limpiar, es ilegible:
hoy vamos a ver hoy vamos a ver cómo funciona cómo funciona este método paso a paso
La opción de quitar líneas repetidas consecutivas y la de unir frases reconstruyen el texto real: «hoy vamos a ver cómo funciona este método paso a paso».
Estadísticas que ofrece
Junto a la transcripción, la herramienta muestra el número de subtítulos procesados, el total de palabras y caracteres del texto extraído y la duración total del vídeo (la diferencia entre el final del último subtítulo y el inicio del primero). Con las palabras y la duración puedes calcular la velocidad de habla en palabras por minuto, un dato útil para locutores y para estimar la extensión de un doblaje.
Privacidad y rendimiento
El análisis del archivo se realiza por completo en tu navegador con JavaScript, sin librerías externas. El contenido de los subtítulos no se sube a ningún servidor ni se almacena, así que puedes procesar material inédito o con derechos sin ninguna preocupación, y la conversión es instantánea incluso con guiones de largometraje.
Herramientas relacionadas en porcentaje.net
- Limpiador de Tiempos en Subtítulos SRT: corrige la sincronización y renumera el archivo.
- Convertidor de VTT a SRT: pasa subtítulos de WebVTT a SubRip.
- Contador de Palabras: mide la extensión de la transcripción.
- Calculadora de Tiempo de Lectura: estima cuánto se tarda en leer el texto.
- Detector de Textos Repetidos: encuentra frases duplicadas que hayan quedado.
Preguntas Frecuentes (FAQ)
¿Acepta también archivos VTT?
Sí. La herramienta detecta automáticamente si el contenido pegado es SubRip (SRT) o WebVTT (VTT) y adapta el análisis: reconoce la cabecera WEBVTT, los bloques NOTE y STYLE, las marcas de tiempo sin hora (MM:SS.mmm) y las etiquetas propias de VTT como <v Nombre>. El resultado es el mismo texto limpio en ambos casos.
¿Puedo quedarme solo con lo que dice cada personaje?
Sí. En «Diálogo y personajes» elige «Agrupar por NOMBRE:» si tus subtítulos usan etiquetas de personaje del tipo ANA: Hola, o «Quitar el guion inicial» si usan el guion de diálogo. En el modo de párrafos, cada intervención se mantiene en su propia línea para que la conversación sea legible.
¿Elimina las descripciones de sonido para sordos?
Si activas la opción correspondiente, sí: quita los fragmentos entre corchetes ([aplausos]), entre paréntesis ((música de fondo)) y las notas musicales ♪ que marcan las canciones. Desactívala si quieres conservar esas acotaciones en la transcripción.
¿Por qué mi transcripción tiene frases repetidas?
Es típico de los subtítulos automáticos, que van mostrando la frase palabra a palabra y repiten el texto anterior en cada subtítulo. Activa «Quitar líneas repetidas consecutivas» y «Unir frases partidas»: la herramienta descarta las repeticiones y reconstruye cada oración completa una sola vez.
¿Se sube el archivo a algún servidor?
No. Todo el procesamiento ocurre en tu navegador. El contenido de los subtítulos no se transmite ni se guarda en ningún momento, por lo que puedes extraer el texto de material confidencial o con derechos de autor con total privacidad.