Extractor de Metadatos de Texto (Front Matter, Cabeceras y Entidades)
Analiza un texto o documento y extrae todos sus metadatos: el front matter YAML o TOML, el bloque de cabeceras clave: valor, los campos en línea, el esquema de encabezados, las entidades (fechas, correos, URL, hashtags, menciones, DOI, ISBN) y las estadísticas de legibilidad y estructura. El informe se genera como texto legible, JSON, YAML o CSV.
- 🗂️ Resumen rápido: ¿qué metadatos extrae?
- Qué se entiende por «metadatos de texto»
- Front matter: YAML, TOML y JSON
- Cabeceras y campos en línea
- Estructura del documento
- Entidades detectadas
- Estadísticas de legibilidad y formato
- Formatos de salida
- Casos de uso
- Herramientas relacionadas en porcentaje.net
- Preguntas Frecuentes (FAQ)
🗂️ Resumen rápido: ¿qué metadatos extrae?
Pega el texto (un post de blog con front matter, un correo con cabeceras, un artículo con fechas y enlaces) y la herramienta te devuelve una ficha con los campos declarados, la estructura y las entidades detectadas. Si solo quieres las estadísticas de lectura, prueba la calculadora de tiempo de lectura; y para extraer solo enlaces o correos, el extractor de enlaces y URL.
Qué se entiende por «metadatos de texto»
Cuando se habla de metadatos de un archivo se piensa en los datos EXIF de una foto o en las propiedades de un .docx, que son información binaria. Pero un documento de texto también lleva metadatos, y muchos de ellos están escritos dentro del propio texto de forma estructurada:
- El front matter de un post de blog: título, fecha, autor, etiquetas, estado de borrador.
- Las cabeceras de un correo electrónico o de una petición HTTP:
From,Subject,Date,Content-Type. - Los campos en línea de Obsidian o Dataview:
estado:: en curso. - La estructura: los encabezados que forman el índice, los enlaces, las imágenes, los bloques de código.
- Las entidades que se pueden reconocer por su patrón: fechas, correos, URL, teléfonos, identificadores DOI e ISBN, hashtags y menciones.
Esta herramienta reúne todo eso en una sola ficha, sin que tengas que buscarlo campo por campo.
Front matter: YAML, TOML y JSON
El front matter es un bloque de metadatos al principio de un archivo, separado del contenido por un delimitador. Lo usan los generadores de sitios estáticos (Jekyll, Hugo, Eleventy, Astro), los gestores de notas y muchos sistemas de documentación:
--- title: Cómo optimizar imágenes para la web date: 2026-05-14 author: Redacción tags: [rendimiento, imágenes, seo] draft: false ---
La herramienta detecta el delimitador (--- para YAML, +++ para TOML, o un objeto JSON al inicio) y convierte el bloque en una tabla de pares clave-valor, resolviendo también las listas entre corchetes. El resto del archivo se analiza como contenido.
Cabeceras y campos en línea
Si el texto empieza con varias líneas del tipo Clave: valor seguidas de una línea en blanco, se interpretan como un bloque de cabeceras al estilo de RFC 5322 (correo) o HTTP. Además, en cualquier punto del texto se reconocen los campos en línea con doble dos puntos (prioridad:: alta) y entre corchetes ([autor:: Ana]), la sintaxis que popularizó el plugin Dataview de Obsidian.
Si pegas HTML, la herramienta también extrae el <title> y las etiquetas <meta name="..." content="..."> y <meta property="og:...">.
Estructura del documento
La herramienta reconstruye el esqueleto del texto:
- Esquema de encabezados: lista jerárquica de los títulos Markdown (
#a######), útil como tabla de contenidos. - Enlaces: número y lista de las URL enlazadas con la sintaxis
[texto](url). - Imágenes: cuántas referencias de imagen
hay. - Bloques de código delimitados por triples comillas invertidas y filas de tabla Markdown.
Entidades detectadas
| Entidad | Qué reconoce |
|---|---|
| Correos | Direcciones usuario@dominio.tld |
| URL | Direcciones http:// y https:// |
| Fechas | ISO 2026-05-14, DD/MM/AAAA y «3 de marzo de 2026» |
| Hashtags y menciones | #etiqueta y @usuario |
| Teléfonos | Números con formato (prefijo, espacios, guiones) |
| DOI e ISBN | Identificadores de publicaciones y libros |
Estadísticas de legibilidad y formato
La ficha incluye métricas del documento, calculadas sobre el contenido (excluyendo el front matter, las cabeceras, las URL y los correos, que distorsionarían las medias):
- Palabras, caracteres con y sin espacios, oraciones, párrafos y líneas.
- Palabras únicas y longitud media de palabra.
- Longitud media de oración en palabras (indicador de legibilidad).
- Tiempo de lectura estimado a 200 palabras por minuto.
- Estilo de fin de línea (LF de Unix o CRLF de Windows) y presencia de marca BOM.
- Formato detectado: texto plano, Markdown, Markdown con front matter, HTML o documento con cabeceras.
Formatos de salida
- Informe legible: una ficha con secciones, pensada para leer y copiar.
- JSON: un objeto estructurado, ideal para procesar el resultado con un script o una API.
- YAML: el mismo contenido en formato de front matter, por si quieres reutilizarlo como cabecera de otro documento.
- CSV (clave;valor): una fila por dato, para abrir en una hoja de cálculo.
Casos de uso
- Autores de blogs estáticos: revisar de un vistazo el front matter y la estructura de un borrador antes de publicarlo.
- Documentalistas y archiveros: catalogar textos extrayendo sus fechas, autores e identificadores.
- Analistas de datos: convertir texto no estructurado en una tabla de campos y entidades.
- SEO y content: comprobar el número de encabezados, enlaces internos y el tiempo de lectura de un artículo. Complementa con el analizador de densidad de palabras clave.
- Investigadores: localizar todos los DOI e ISBN citados en un documento.
Herramientas relacionadas en porcentaje.net
- Extraer Enlaces y URL de un Texto: si solo necesitas las direcciones.
- Extraer Correos Electrónicos: aísla las direcciones de email.
- Contador de Palabras: recuento y estadísticas básicas de texto.
- Calculadora de Tiempo de Lectura: estima la duración de lectura de un texto.
- Extractor de Palabras Clave: obtén los términos más representativos.
Preguntas Frecuentes (FAQ)
¿Puede leer los metadatos EXIF de una foto o las propiedades de un Word?
No. Esos metadatos están en la parte binaria del archivo y requieren un lector específico. Esta herramienta trabaja con texto: extrae los metadatos que están escritos dentro del contenido de forma estructurada, como el front matter de un post, las cabeceras de un correo, los campos en línea de Obsidian o las etiquetas <meta> de un HTML pegado.
¿Qué es el front matter y qué formatos admite?
El front matter es un bloque de metadatos al principio de un archivo, separado del contenido por un delimitador. La herramienta reconoce los tres estilos habituales: YAML entre ---, TOML entre +++ y un objeto JSON al inicio. Convierte el bloque en una tabla de pares clave-valor y resuelve las listas.
¿Por qué las estadísticas no cuentan las URL ni los correos?
Porque una dirección larga se contaría como una sola «palabra» de treinta caracteres y distorsionaría la longitud media de palabra y la de oración. Para que las métricas de legibilidad sean representativas, la herramienta las sustituye por un espacio antes de contar. Las URL y los correos sí aparecen, completos, en la sección de entidades.
¿Puedo obtener el resultado en JSON para procesarlo?
Sí. En «Formato de salida» elige JSON y obtendrás un objeto con las claves frontMatter, headers, structure, entities, stats y detectedFormat, listo para consumir desde un script. También puedes exportar en YAML (para reutilizar como cabecera) o CSV (para una hoja de cálculo).
¿Se envía mi texto a algún servidor?
No. Todo el análisis se realiza en tu navegador con JavaScript, sin librerías externas. El texto no se transmite ni se almacena en ningún momento, por lo que puedes analizar borradores, correos o documentos confidenciales con total privacidad.