Convertidor de RTF a Texto Plano (Rich Text a TXT)
Extrae el texto legible de un documento RTF (Rich Text Format). La herramienta implementa un analizador con pila de grupos que descarta las tablas de fuentes y colores, traduce las palabras de control de salto y espacio, y decodifica los caracteres \uN y \'hh según la página de códigos declarada en el archivo.
📰 Resumen rápido: ¿cómo saco el texto de un RTF?
Abre el archivo .rtf con un editor de texto, copia todo su contenido (empieza por {\rtf1), pégalo en la herramienta y copia el texto plano resultante. Si tu documento de origen es HTML o Markdown en lugar de RTF, usa el convertir texto a texto plano.
Qué es RTF y por qué extraer su texto
El Rich Text Format es un formato de documento creado por Microsoft en 1987 para intercambiar texto con formato entre programas distintos. A diferencia de .docx, un RTF es un archivo de texto legible: todo el formato se expresa con palabras de control que empiezan por barra invertida (\b para negrita, \fs24 para tamaño de fuente, \par para fin de párrafo) y con grupos delimitados por llaves. Sigue siendo el formato por defecto del Bloc de notas enriquecido de Windows (WordPad) y una opción de exportación habitual en procesadores de texto.
Extraer solo el texto de un RTF es útil para:
- Recuperar el contenido de un documento antiguo sin abrir un procesador de texto pesado.
- Pegar el texto en un formulario, un correo o un CMS que no admite formato.
- Contar palabras y caracteres reales del documento.
- Alimentar un sistema de indexación, búsqueda o análisis de texto.
- Comparar el contenido de dos versiones sin el ruido del marcado.
Cómo funciona el analizador
La herramienta lee el código RTF carácter a carácter manteniendo una pila de grupos. Cada llave de apertura { crea un nuevo nivel que hereda el estado del anterior, y cada llave de cierre } lo descarta. Sobre esa base aplica estas reglas:
- Destinos que se ignoran: cuando un grupo empieza por una palabra de control como
\fonttbl,\colortbl,\stylesheet,\info,\picto cualquier grupo marcado con\*, todo su contenido se descarta. Ahí es donde el RTF guarda la tabla de fuentes, la paleta de colores, los metadatos y las imágenes. - Palabras de control de texto:
\pary\linese convierten en saltos de línea,\taben tabulación,\pagey\secten dobles saltos, y\emdash,\endash,\bullet,\ldblquoteo\rdblquoteen sus símbolos Unicode. - Palabras de control de formato:
\b,\i,\f0,\fs28,\cf2,\qc… se ignoran, porque solo afectan al aspecto. - Caracteres especiales:
\'hhes un byte en hexadecimal que se decodifica según la página de códigos;\uNes un carácter Unicode por su número, seguido de unos caracteres de reserva que se saltan (según\uc). - Escapes:
\\,\{y\}representan la barra y las llaves literales;~es un espacio irrompible.
La página de códigos: por qué importa
Los bytes \'hh no significan nada por sí solos: hay que interpretarlos con una tabla de codificación. El RTF la declara con \ansicpg. La más común es Windows-1252 (Europa occidental), donde \'f1 es «ñ» y \'e9 es «é». La herramienta ofrece:
- Automática: lee el valor de
\ansicpgdel propio archivo y usa esa tabla. - Windows-1252: fuérzala si el archivo no la declara o la declara mal.
- Windows-1250: Europa central (polaco, checo, húngaro).
- Windows-1251: alfabeto cirílico (ruso, búlgaro, ucraniano).
Los caracteres escritos con \uN (Unicode) se decodifican siempre correctamente, sea cual sea la página de códigos.
Ejemplo
Entrada RTF:
{\rtf1\ansi\ansicpg1252\deff0
{\fonttbl{\f0\fnil Calibri;}}
{\colortbl;\red0\green0\blue0;}
\f0\fs24 Este es un \b documento\b0 de ejemplo.\par
El se\'f1or Mu\'f1oz pag\'f3 3\~\'80 por el caf\'e9.\par}
Salida:
Este es un documento de ejemplo. El señor Muñoz pagó 3 € por el café.
Opciones de salida
- Conservar saltos de párrafo: mantiene la separación entre párrafos; si lo desactivas, todo el texto se une en un solo bloque.
- Conservar tabulaciones: mantiene los
\tabcomo caracteres de tabulación (útil para tablas simples); si lo desactivas, se sustituyen por espacios. - Colapsar líneas en blanco múltiples: reduce tres o más saltos consecutivos a una única línea en blanco.
La herramienta también informa del número de caracteres, palabras y párrafos del texto extraído y de cuántos grupos de destino ha descartado, lo que da una idea de cuánta información de formato contenía el archivo.
Limitaciones
El objetivo es extraer el texto, no reconstruir el documento. Por tanto:
- Las tablas pierden su cuadrícula: las celdas se separan con tabulaciones y las filas con saltos de línea.
- Las imágenes incrustadas (
\pict) se descartan. - Los campos automáticos (fecha, número de página, referencias) se omiten o se sustituyen por su último resultado calculado.
- Las notas al pie y los comentarios se eliminan junto con su grupo de destino.
Si el resultado necesita un repaso, puedes pasarlo por el limpiador de texto online o contar su extensión con el contador de palabras.
Herramientas relacionadas en porcentaje.net
- Convertir Texto a Texto Plano: para texto enriquecido de HTML o Markdown.
- Convertidor de LaTeX a Texto Plano: extrae el texto de un archivo
.tex. - Eliminar Código HTML de un Texto: quita etiquetas y deja el contenido.
- Contador de Palabras: mide la extensión real del texto extraído.
- Limpiador de Texto Online: elimina espacios y líneas sobrantes.
Preguntas Frecuentes (FAQ)
¿Tengo que subir el archivo .rtf?
No. Abre el .rtf con cualquier editor de texto plano (el Bloc de notas sirve), copia todo su contenido y pégalo en el cuadro de la herramienta. Todo el análisis ocurre en tu navegador; no se sube ni se guarda ningún archivo.
¿Por qué aparecen caracteres raros en lugar de acentos?
Suele deberse a una página de códigos incorrecta. Si la detección automática no acierta (por ejemplo, si el archivo no declara \ansicpg), prueba a seleccionar manualmente Windows-1252 para textos en español y otras lenguas de Europa occidental, o Windows-1251 si el documento está en cirílico.
¿Conserva los saltos de párrafo?
Sí, por defecto. Cada \par del RTF se convierte en un salto de línea, y \sect y \page en dobles saltos. Puedes desactivar la opción «Conservar saltos de párrafo» si prefieres obtener todo el texto en un único bloque continuo.
¿Qué son los «grupos descartados» que muestra la herramienta?
Son los grupos de destino del RTF que contienen información que no es texto del documento: la tabla de fuentes (\fonttbl), la de colores (\colortbl), la hoja de estilos (\stylesheet), los metadatos (\info), las imágenes (\pict) y cualquier grupo marcado con \*. El contador te indica cuántos ha ignorado el analizador.
¿El texto que pego se envía a algún servidor?
No. El analizador RTF se ejecuta por completo en tu navegador con JavaScript. Ni el código RTF de entrada ni el texto plano de salida se transmiten ni se almacenan, así que puedes convertir documentos confidenciales con total privacidad.