Jerarquía semántica
Distingue encabezados, párrafos y elementos de lista dentro de cada página.
Recupera páginas, títulos, párrafos, listas y coordenadas en un XML limpio. Incluye OCR gratuito para documentos escaneados.
Conversor estructurado
Arrastra tu archivo PDF aquí
Texto nativo, escaneado o documento mixto
Sin subidas · Sin registro · Sin límite diario
XML bien formado
Escapa caracteres especiales y elimina controles incompatibles con XML 1.0.
Estructura verificable
Conserva páginas, orden, roles y coordenadas sin mezclar todo el texto.
Solo en memoria
El PDF y el XML desaparecen al cerrar o recargar la pestaña.
No es una cadena de texto gigante
Cada elemento conserva su página, orden y función para facilitar búsquedas, migraciones, análisis documental y automatizaciones.
Distingue encabezados, párrafos y elementos de lista dentro de cada página.
Registra X, Y, ancho, alto, tamaño de fuente y negrita de las líneas nativas.
Reconoce únicamente las páginas sin texto suficiente y conserva el origen de cada resultado.
Tres pasos
Carga un documento local o reutiliza el PDF activo de otra herramienta.
Elige salida semántica o maquetación y configura OCR y metadatos.
Revisa el XML generado y guárdalo sin marcas de agua ni límites diarios.
Semántica frente a apariencia
XML semántico prioriza una lectura limpia: páginas, encabezados, párrafos y listas. Es la opción recomendada para indexación, archivo, traducción y procesamiento de lenguaje.
XML de maquetación añade la geometría de cada línea de texto nativa. Resulta útil para analizar zonas, columnas, formularios y posiciones sin rasterizar el documento.
El PDF describe dónde dibujar elementos, pero no siempre declara qué representa cada tabla o figura. Por eso el resultado conserva evidencias medibles y evita inventar relaciones que el original no contiene.
El PDF original permanece activo para continuar sin volver a seleccionarlo.
Obtén TXT, Markdown o JSON cuando no necesitas etiquetas XML.
Abrir herramientaReconstruye tablas como celdas editables para trabajar con datos.
Abrir herramientaRecupera fotos, logos y gráficos raster incrustados en el PDF.
Abrir herramientaEstructura, coordenadas, OCR, tablas, imágenes, validez y privacidad del archivo XML.
Carga el PDF, elige XML semántico o de maquetación y pulsa Convertir PDF a XML. El archivo se genera localmente y queda disponible para descargar o copiar.
La raíz identifica el modo y contiene metadatos, estadísticas y páginas. Cada página conserva títulos, párrafos y listas; el modo de maquetación añade líneas con posición, tamaño, fuente y negrita.
Sí. Si una página no contiene suficiente texto seleccionable, el OCR local puede reconocer texto impreso en español, inglés o ambos. El texto OCR se guarda de forma semántica sin inventar coordenadas inexistentes.
El semántico es más compacto y adecuado para búsquedas, archivos e integraciones. El de maquetación conserva además las coordenadas de las líneas nativas para analizar la disposición de la página.
No incrusta binarios de imagen. Esta herramienta se concentra en texto, estructura y geometría. Para recuperar fotos y gráficos originales utiliza Extraer imágenes de PDF.
Conserva las líneas y sus coordenadas, lo que permite procesar tablas posteriormente, pero no afirma relaciones de filas y columnas cuando el PDF no contiene una estructura semántica fiable. Para hojas tabulares utiliza PDF a Excel.
El generador declara UTF-8, escapa los caracteres reservados y elimina controles incompatibles con XML 1.0. La estructura usa un espacio de nombres estable de Formato Rápido.
No. La lectura, el OCR y la creación del XML ocurren en la memoria de tu navegador. El documento no se guarda ni se utiliza con fines publicitarios o de entrenamiento.
.pdf · Documento de página fija
PDF representa documentos electrónicos mediante páginas de geometría fija para que puedan intercambiarse, verse e imprimirse de forma consistente.
.xml · Datos estructurados con etiquetas
XML representa información jerárquica mediante elementos y atributos legibles por personas y programas, con reglas estrictas para formar documentos interoperables.