Todas las herramientas funcionan en tu navegador — tus archivos nunca salen de tu dispositivo.
All tools154

PDF

PDF a texto

Extraer el texto plano de un PDF.

Qué hace. Esta herramienta extrae la capa de texto de un PDF. Solo funciona si existe: un PDF procedente de un escaneo no contiene texto sino imágenes, y ahí hace falta reconocimiento óptico.
Funciona en tu navegadorNo se sube nadaSin registroFunciona sin conexión

Cómo usar PDF a texto

  1. Elige tu PDF.
  2. Selecciona todas las páginas o un rango.
  3. Copia el texto o guárdalo.

Dos clases de PDF

Se ven iguales en pantalla y se comportan de forma opuesta.

Un PDF generado desde un procesador de textos o un programa de maquetación contiene texto real. Se puede seleccionar, buscar y extraer aquí.

Un PDF procedente de un escáner o de una foto contiene imágenes de páginas. No hay nada que seleccionar, porque no hay texto: solo una imagen con texto encima.

La prueba dura dos segundos: abre el PDF e intenta seleccionar una palabra. Si no puedes, es un escaneo y esta herramienta no dará nada. Usa el reconocimiento óptico.

Existe una forma intermedia: un escaneo bajo el cual se ha añadido una capa de texto invisible por reconocimiento. Esa sí se puede buscar, y esta herramienta funciona, heredando los errores que cometiera el reconocimiento.

Por qué se pierde el formato

Un PDF no guarda párrafos. Guarda la posición de cada fragmento de texto en la página.

De ahí que el resultado salga a veces desordenado. El orden de los fragmentos en el archivo no tiene por qué ser el de lectura, y con dos columnas se entremezcla con frecuencia.

Lo que casi siempre se pierde: las columnas, la estructura de las tablas, los encabezados y pies que acaban en medio del texto, y los guiones de final de línea que se quedan clavados dentro de las palabras.

Para un documento corriente a una columna el resultado es bueno. Para una memoria anual con columnas y tablas, el repaso es inevitable.

Usos habituales

Lo más frecuente: poder buscar o reutilizar sin teclear de nuevo.

Útil para recoger una cita de un informe, sacar una dirección de una carta, llevar el texto de un PDF antiguo a un documento nuevo, o contar cuántas palabras tiene.

Menos útil si esperas una conversión «de PDF a Word». Obtienes el texto, no la maquetación. Para un documento editable que conserve el formato hace falta otra conversión, que rara vez da un resultado limpio.

En documentos confidenciales, ten presente algo: el texto oculto en el PDF bajo un recuadro de color sale aquí tal cual. Por eso ese recuadro no es una forma segura de censurar.

Preguntas frecuentes

¿Por qué no obtengo texto?

Tu PDF es un escaneo. Intenta seleccionar una palabra; si no puedes, usa reconocimiento óptico.

¿Se conserva el formato?

No, obtienes texto plano. Columnas y tablas se pierden.

¿Por qué sale el texto mezclado?

Con varias columnas, el texto sale en el orden del archivo, no en el de lectura.

¿Sirve para pasar un PDF a Word?

Obtienes el texto, no la maquetación. Es otra conversión.

¿Sale el texto censurado con un recuadro?

Sí, si solo está tapado. Por eso no es un método seguro.

¿Se sube mi PDF?

No.