Extractor de texto PDF que une las líneas cortadas en párrafos
Elige un PDF y el texto de todas sus páginas aparecerá en el cuadro de resultado. Une las líneas cortadas en párrafos y copia solo las páginas que necesites o guárdalas como TXT.
Suelta aquí un PDF para sacar su texto
El archivo se lee en este navegador y no se sube a ningún servidor.
Hasta 50 MiB · 200 páginas · para PDF que contienen texto (no se aplica OCR a imágenes escaneadas)
Es un PDF de ejemplo de 4 páginas creado por nosotros. Las páginas 1 a 3 tienen encabezado y número de página; la 4 solo tiene un dibujo. Cambia las opciones de saltos de línea y encabezados para comparar resultados. Elige tu propio documento arriba.
Leyendo 0 / 0 páginas
Todavía no hay texto extraído.
Elige un PDF: se leerá el texto de todas las páginas y se mostrará aquí.
El texto dentro de imágenes escaneadas no se extrae porque la herramienta no aplica OCR. No se procesan PDF con contraseña de apertura ni con la copia restringida. El texto sigue el orden guardado en el PDF, así que las columnas y tablas pueden salir desordenadas. El TXT se guarda en UTF-8 con BOM para que el Bloc de notas y Excel lo abran bien.
sin rodeos.
- Todo a la vistaLa zona de entrada y los resultados se reconocen rápido.
- Resultado primeroEl número principal va delante; el detalle queda debajo.
- Menos requisitosSin registro ni datos innecesarios antes de usar la herramienta.
Cómo sacar el texto de un PDF y dejarlo limpio
Extraer texto de PDF consiste en sacar los caracteres guardados dentro del archivo y convertirlos en texto editable. Si copias directamente desde un visor de PDF, normalmente se añade un salto de línea al final de cada línea visible y las frases llegan troceadas. Esta herramienta lee el texto página por página, une las líneas de un mismo párrafo y te deja copiar solo las páginas que necesitas o guardarlas en un archivo TXT.
Funciona con PDF que contienen texto real, como documentos exportados desde Word, Google Docs o LibreOffice y los informes que se descargan de la web. Los PDF creados al escanear papel solo contienen imágenes; como la herramienta no aplica OCR, esas páginas no devuelven texto y aparecen aparte como páginas sin texto. El archivo se lee en este navegador y no se envía a ningún servidor.
Primero, comprueba que el PDF tiene texto
Dos PDF pueden verse iguales y guardar cosas muy distintas: uno conserva los caracteres como texto y el otro guarda cada página como una imagen. Si en un visor de PDF puedes arrastrar el cursor sobre una frase y se resalta palabra por palabra, el archivo contiene texto. Si se selecciona toda la página como una sola imagen, o no se puede seleccionar nada, lo más probable es que sea un PDF escaneado.
Si abres aquí un PDF escaneado, esas páginas aparecen como «sin texto». Los archivos mixtos son habituales, por ejemplo una portada que es solo imagen seguida de un cuerpo con texto. Revisa los números de página que se indican bajo el resultado y pasa solo esas páginas por un programa de OCR.
De elegir el PDF a guardar el TXT
Al elegir o soltar un PDF, la herramienta lee el texto una vez, de la primera a la última página. Mientras lee, una barra de progreso muestra el número de páginas, y al terminar aparece en el cuadro de resultado el texto de todas las páginas elegidas. Si después cambias el tipo de salto de línea u otra opción, el resultado se reorganiza al instante sin volver a leer el archivo.
Antes de usar un documento personal puedes pulsar Abrir PDF de ejemplo para ver qué hace cada opción. El ejemplo tiene tres páginas con encabezado y número de página y una página que solo contiene un dibujo; se abre únicamente cuando pulsas el botón.
- Elige un PDF y comprueba el nombre, el total de páginas y cuántas tienen texto.
- Escribe las páginas a extraer si no necesitas todas.
- Elige el tipo de salto de línea, las marcas de página, la eliminación de encabezados y números de página y la limpieza de espacios.
- En Ver, lee todas las páginas elegidas o una sola; con una página se muestra la original junto al texto.
- Llévate el resultado con Copiar todo, Copiar página o Guardar TXT.
Unir en párrafos o mantener las líneas del PDF
La mayoría de los PDF no saben qué es un párrafo. Cada línea visible se guarda con su posición, y por eso al copiar se añade un salto después de cada línea. Unir en párrafos junta las líneas de un mismo párrafo en un texto continuo y deja una línea en blanco entre párrafos.
Por ejemplo, si un PDF muestra «Los datos que recogemos incluyen tu nombre y» en una línea y «tu correo electrónico.» en la siguiente, el resultado es «Los datos que recogemos incluyen tu nombre y tu correo electrónico.». Líneas del PDF deja ambas líneas tal cual, algo útil para direcciones, poemas o listas en las que la posición de la línea tiene sentido.
Los límites de párrafo se deducen del espacio vertical. Cuando el hueco entre dos líneas es aproximadamente 1,5 veces el interlineado habitual de la página, empieza un párrafo nuevo. También empiezan párrafo los títulos con otro tamaño de letra, las líneas que vuelven hacia arriba porque el texto pasa a la columna siguiente y las que comienzan con una viñeta como •, 1. o (1).
Cómo se tratan los espacios al unir líneas
Las líneas en español se unen con un solo espacio. Los caracteres chinos y la escritura japonesa se unen sin espacio, porque esas lenguas no separan las palabras.
Cuando una palabra se parte con un guion al final de la línea, como «orde-» y «nador», el resultado es «orde-nador», con el guion. Borrarlo daría «ordenador», pero la misma regla estropearía palabras que llevan guion de verdad, como «franco-alemán» o «COVID-19». La herramienta conserva todos los caracteres en lugar de adivinar, así que revisa los guiones de final de línea que queden en textos justificados.
Quitar encabezados y números de página repetidos
Los informes suelen repetir el título arriba y un número como «Página 3 de 20» abajo en cada página, y esas líneas acaban repartidas por todo el texto extraído. Con Quitar encabezados y números de página repetidos activado, la herramienta compara la primera y la última línea de cada página que tenga al menos tres líneas (dos por cada borde si la página tiene cinco o más) y elimina las que se repiten entre páginas. Nunca vacía una página, así que una página con un único título de capítulo se conserva.
Las líneas que solo cambian en sus números cuentan como la misma línea, de modo que «Página 1 de 20» y «Página 2 de 20» se consideran repetidas. Una línea se elimina solo si aparece en al menos el 60 % de las páginas comparadas y en tres páginas como mínimo.
La opción viene desactivada porque una línea necesaria, como la cabecera de una tabla que se repite arriba de cada página, puede cumplir la misma regla de posición. Con la opción activa se muestra bajo el resultado cuántas líneas se quitaron; si la cifra no cuadra, desactívala y compara.
Extraer solo las páginas que necesitas
Si escribes 2,4-6 en Páginas a extraer, solo entran en el resultado las páginas 2, 4, 5 y 6. La coma combina páginas o rangos separados y el guion indica un rango continuo. Si escribes 6,2, la página 2 sigue saliendo antes que la 6, y una página repetida aparece una sola vez.
Los números cuentan como 1 la primera página del PDF y pueden no coincidir con la numeración impresa: si hay una portada y un índice delante, la página 1 impresa es aquí la 3. Elige una página en Ver y compara con la vista previa de la página original para acertar con el número.
Marcas de página y páginas sin texto
Con Añadir marcas de página activado, el texto de cada página empieza con una línea como [Página 3]. Las páginas sin texto aparecen como [Página 5 · sin texto], así que ves dónde están los huecos sin salir del resultado. Las marcas resultan útiles cuando necesitas citar números de página.
Sin marcas, las páginas se separan con una línea en blanco y las que no tienen texto no aparecen. Un párrafo que continúa en la página siguiente también se corta en el cambio de página, así que revisa esos puntos si vas a mover un texto largo de una sola vez.
Guardar TXT y abrirlo en otros programas
Guardar TXT descarga el texto de todas las páginas elegidas con el nombre original más _text, de modo que informe.pdf pasa a ser informe_text.txt. Aunque estés viendo una sola página, el archivo contiene toda la selección. Para guardar una sola página, escribe primero solo ese número en Páginas a extraer.
El archivo se guarda en UTF-8 con marca de orden de bytes (BOM). Excel y las versiones antiguas del Bloc de notas pueden interpretar mal un UTF-8 sin BOM y mostrar tildes y eñes rotas; con la BOM reconocen que el archivo es UTF-8. Los saltos de línea son de tipo Windows (CR+LF), que el Bloc de notas, Word y los editores de macOS y Linux leen sin problema.
Cuando el texto sale dañado o desordenado
Lo que ves en un PDF y lo que se puede extraer no siempre coincide. Para mostrar una página basta con la forma de cada glifo, pero para copiar hace falta un mapa que diga qué carácter representa cada uno. Los PDF sin ese mapa producen símbolos o caracteres desconocidos, y las páginas con muchos de ellos se marcan como posible texto dañado. Volver a exportar el PDF desde el programa original con las fuentes incrustadas suele resolverlo.
Las letras acentuadas y la ñ que el PDF guarda como letra base más una tilde aparte se recomponen en un solo carácter, y ligaduras como «fi» o «fl» se convierten en letras normales, de modo que las búsquedas en el texto extraído funcionan como esperas.
El texto sigue el orden guardado en el PDF. Suele coincidir con el orden de lectura, pero los artículos a dos columnas, las tablas anchas y los pies de figura pueden salir intercalados. Cada fila de una tabla se convierte en una línea con las celdas separadas por espacios, así que no se pega en Excel como tabla.
PDF que no se pueden procesar y límites
Se procesa un PDF cada vez, de hasta 50 MiB y 200 páginas. MiB es una unidad binaria: 50 MiB son 52 428 800 bytes. Los dos límites se aplican por separado, así que un archivo pequeño de 201 páginas también se rechaza. Divide los documentos largos en partes de 200 páginas o menos y extráelas una tras otra.
Los PDF protegidos con contraseña de apertura no se procesan, porque la herramienta no pide contraseñas. Tampoco se procesan los PDF cuyo autor restringió la copia de texto. Los que solo limitan la impresión o la edición y permiten copiar se extraen con normalidad.
- Archivos vacíos (0 bytes) o que no son PDF: vuelve a exportar el documento como PDF desde su programa original. Cambiar la extensión a .pdf no sirve.
- PDF dañados: comprueba si otro visor los abre y, si es así, usa su opción de guardar como PDF para crear una copia limpia.
- Varios archivos a la vez: añádelos de uno en uno. Al añadir un archivo nuevo se vacían el documento y los resultados anteriores.
Sin subidas, y qué borra Reiniciar
El contenido de tu PDF no se envía ni se guarda en ningún servidor para extraer el texto. La lectura del archivo, la limpieza del texto, las vistas previas y la creación del TXT ocurren en el navegador que estás usando, sin registro. La página sigue cargando su diseño, sus scripts y los anuncios por la red, así que eso no significa que la web no haga ninguna conexión.
Reiniciar, o añadir otro archivo, vacía el documento y los resultados dentro de la herramienta. No borra tu PDF original ni los TXT que ya hayas descargado. El texto copiado queda en el portapapeles, así que en un ordenador compartido copia después otra cosa para sobrescribirlo.
Cinco comprobaciones antes de copiar o guardar
El texto extraído es la información guardada en el PDF, no una copia del aspecto de la página. En documentos importantes, repasa estos puntos antes de usarlo.
- Compara el número de páginas y de caracteres bajo el resultado con lo que esperabas; una cifra muy baja suele indicar páginas sin texto.
- Busca avisos de páginas sin texto o con posible texto dañado.
- En páginas con columnas o tablas, elige la página en Ver y compara el orden con el original.
- Si activaste la eliminación de encabezados, revisa cuántas líneas se quitaron y que no falte nada importante.
- Vuelve a comprobar cifras, fechas, importes y nombres con el original, y abre el TXT guardado en el programa donde lo vayas a usar.
Preguntas frecuentes
He abierto un PDF escaneado y no sale ningún texto. ¿Por qué?
Un PDF escaneado guarda cada página como una imagen, así que no hay texto que extraer. Esta herramienta no aplica OCR y marca esas páginas como sin texto. Pasa el archivo por un programa de OCR para crear un PDF con texto y ábrelo después aquí.
Al copiar desde el visor se corta cada línea. ¿Puedo unirlas?
Sí. Elige Unir en párrafos y las líneas de cada párrafo se juntan con un solo espacio, dejando una línea en blanco entre párrafos. En documentos con un interlineado irregular un párrafo puede cortarse donde no toca, así que lee el resultado y corrige esos puntos.
El TXT guardado muestra caracteres raros en Excel. ¿Qué hago?
El archivo se guarda en UTF-8 con BOM para que la mayoría de programas detecten la codificación. Si aun así ves tildes o eñes rotas, usa la opción de importar y elige UTF-8 (65001) como origen del archivo. Si otro programa volvió a guardar el archivo, puede que en ese momento cambiara la codificación.
¿Las tablas salen separadas por celdas?
No. Cada fila de la tabla sale como una línea con las celdas separadas por espacios. Los bordes y las celdas combinadas no se extraen, así que al pegar en Excel no se reconstruye la tabla. Con Líneas del PDF es más fácil comparar las filas con el original.
¿Respeta el orden en los artículos a dos columnas?
Normalmente sí, porque la mayoría de los PDF guardan la columna izquierda antes que la derecha. Algunos programas guardan las líneas alternadas y entonces el orden se mezcla. Elige esa página en Ver y compárala con la vista previa original para comprobarlo.
¿Por qué no puedo extraer el texto de un PDF protegido contra copia?
El autor configuró un permiso que no permite copiar el texto y esta herramienta no lo salta. Los PDF que solo limitan la impresión o la edición y permiten copiar sí se pueden extraer. Si necesitas el texto, pide al autor una versión sin esa restricción.
¿Cómo extraigo un PDF de más de 200 páginas?
Se procesan hasta 200 páginas a la vez. Divide el PDF en partes de 200 páginas o menos, extrae cada parte y pega los resultados en orden. Las marcas de página mostrarán entonces la numeración de cada parte, no la del documento original.
He activado quitar encabezados y el encabezado sigue ahí.
Una línea solo cuenta como repetida si se pueden comparar al menos tres páginas y el encabezado cambia únicamente en sus números. Tampoco se quitan los encabezados que no están guardados como primera o última línea de cada página. En esos casos, bórralos a mano en el resultado.
¿Puedo editar el texto en el cuadro de resultado?
El cuadro de resultado es de solo lectura para que lo que ves coincida siempre con lo que se copia o se guarda. Copia el texto o guarda el TXT y edítalo en el Bloc de notas, Word o el editor que prefieras.
Las tildes y la ñ salen separadas de la letra. ¿Se puede arreglar?
La herramienta recompone automáticamente las letras que el PDF guarda como letra base más tilde aparte, de modo que suelen salir como un solo carácter. Si siguen viéndose separadas, el PDF guarda la tilde como un elemento independiente en otra posición; vuelve a exportarlo desde el programa original y prueba de nuevo.