Aplicar OCR a un PDF escaneado
Reconoce el texto de un PDF escaneado y descarga una copia buscable: las páginas se ven idénticas, pero ahora puedes seleccionar, copiar y buscar el texto. También obtienes una exportación a texto plano. El reconocimiento se ejecuta íntegramente en tu navegador — la mayoría de webs de OCR suben tus documentos; esta no puede.
100% privado: los archivos se procesan en tu navegador y nunca se suben a ningún servidor.
Cómo funciona
- Arrastra un PDF escaneado al recuadro de arriba y elige el idioma del documento.
- Pulsa «Reconocer texto» — el motor se carga una vez y procesa cada página en tu dispositivo.
- Descarga el PDF buscable, el texto plano, o ambos.
La diferencia entre un escaneo y un documento
Un PDF escaneado parece un documento, pero para un ordenador es solo una fotografía de uno. No hay texto dentro — solo una imagen de texto — y por eso no puedes seleccionarlo, copiarlo ni buscarlo. El OCR (reconocimiento óptico de caracteres) lee esas imágenes como lo harías tú, reconoce las letras y añade una capa de texto real por debajo. La página se ve idéntica, pero ahora se comporta como un documento de verdad.
Qué obtienes de vuelta
Dos salidas. La primera es un PDF buscable: tus páginas originales con una capa de texto invisible añadida encima, para que puedas seleccionar y buscar el texto mientras la página sigue viéndose exactamente como se escaneó. La segunda es una exportación en texto plano de todo lo que el OCR reconoció, lista para pegar en otro sitio. El PDF buscable es lo que hace utilizables los archivos escaneados — por fin puedes encontrar un documento buscando su contenido.
OCR que se ejecuta en tu dispositivo
Esto es poco habitual e importa. Casi todos los servicios de OCR suben tus documentos a un servidor para procesarlos, lo que es un problema real dado que los documentos que la gente más necesita pasar por OCR — contratos, informes médicos, papeles históricos — son justo los privados. Pdfect ejecuta un motor OCR en WebAssembly directamente en tu navegador, con los modelos de idioma servidos desde esta web y cacheados para reutilizarlos. Tus escaneos nunca se suben, y tras la primera vez el OCR funciona incluso sin conexión.
Conseguir la mejor precisión
La calidad del OCR depende mucho de la entrada. Los escaneos limpios y rectos a 150 DPI o más se leen con mucha precisión; las páginas torcidas, de baja resolución, tenues o manuscritas son más difíciles, ya que el OCR lee con fiabilidad texto impreso, no manuscrito. Elegir el idioma correcto — o ambos idiomas para un documento bilingüe — también mejora los resultados notablemente. Si un escaneo es tenue, reescanearlo con más contraste antes del OCR merece la pena.
Preguntas frecuentes
¿Qué le hace exactamente el OCR a mi PDF?
Añade una capa de texto invisible sobre cada página escaneada. La imagen de la página queda exactamente igual, pero los lectores de PDF ya pueden seleccionar, copiar y buscar el texto que hay debajo.
¿Qué idiomas soporta?
Inglés y español, por separado o combinados para documentos bilingües. Los modelos de reconocimiento se sirven desde esta misma web y se cachean — tras el primer uso, el OCR funciona incluso sin conexión.
¿Por qué es más lento que otras webs de OCR?
Porque no se sube nada: el trabajo lo hace tu propio dispositivo. Una página típica tarda unos segundos. A cambio, los documentos confidenciales — contratos, informes médicos — nunca salen de tu máquina.
¿Qué precisión tiene el reconocimiento?
En escaneos limpios a 150 DPI o más, la precisión es comparable a las herramientas comerciales. Las páginas torcidas, de baja resolución o manuscritas reducen la precisión — los motores de OCR solo leen con fiabilidad texto impreso.