IureOCR – busca texto en documentos escaneados y edita pdf

IureOCR - busca texto en documentos escaneados y edita pdf

App gratuita de iurefficient para aplicar OCR y editar PDFs. Reconoce el texto de escaneos y fotos de documentos en tu propio equipo y deja un PDF con texto buscable, listo para subir a Iurefficient. Es la cuarta app de escritorio de Iurefficient, junto a IureTranscribe, IureEditor e IureDav, y comparte con ellas la cuenta, el llavero y la sesión.

Reconoce el texto de escaneos y fotos de documentos en tu propio equipo y deja un PDF con texto buscable, listo para subir a Iurefficient. Es la cuarta app de escritorio de Iurefficient, junto a IureTranscribe, IureEditor e IureDav, y comparte con ellas la cuenta, el llavero y la sesión.

Qué hace

  1. OCR local con Tesseract en español e inglés (más idiomas si tu Tesseract los tiene). Nada sale del equipo: ni el documento ni el texto.
  2. Acepta PDF escaneados e imágenes (JPG, PNG, TIFF, BMP, WEBP). El resultado es un PDF con la imagen original y, encima, una capa de texto invisible: se puede buscar, copiar y el servidor de Iurefficient lo indexa sin volver a procesarlo. Además deja un .txt con el texto plano.
  3. Omite los PDF que ya tienen texto (mismo criterio que el servidor: menos de 100 caracteres en las tres primeras páginas = hay que reconocer). Se puede forzar.
  4. Guardar en Iurefficient: en un proyecto (API REST) o en cualquier carpeta del árbol de documentos (WebDAV). Con la unidad de IureDav montada, basta con elegirla como carpeta de salida.
  5. Cola con progreso por página, cancelación y reintento. Arrastra archivos a la ventana, ábrelos con IureOCR desde el sistema o con enlaces iureocr://ocr?file=….
  6. Para editar el resultado sugiere OnlyOffice Desktop Editors: lo detecta si está instalado y, si no, enlaza su descarga. No se incluye.
  7. Interfaz en inglés y español: inglés por defecto y español si el sistema operativo está en español; se puede elegir en Ajustes → Apariencia. Es independiente de los idiomas del texto que reconoce Tesseract.

Pendiente para versiones siguientes (ver CHANGELOG): herramientas PDF (unir, dividir, extraer y borrar páginas, rotar, proteger con contraseña, marca de agua, numerar), compresión real de imágenes, rescate de páginas ilegibles con un modelo de visión y la lista de documentos pendientes de OCR de la instancia.

Cómo funciona por dentro

  1. pdfium rasteriza cada página del PDF a JPEG a la resolución elegida (300 ppp por defecto). Las imágenes se pasan tal cual.
  2. Tesseract recibe la lista de páginas y produce, él mismo, el PDF con la capa de texto (su renderizador pdf, el mismo que usa ocrmypdf) y el .txt.
  3. El resultado se guarda junto al original con el sufijo - OCR (configurable) o en una carpeta fija.

Un PDF con texto ya legible no se rasteriza: se avisa y se ofrece forzarlo.

Tesseract en cada sistema

Sistema De dónde sale Tesseract Modelos de idioma
Linuxel paquete del sistema: el .deb/.rpm dependen de tesseract-ocr con spa y englos incluidos en la app (tessdata_fast)
Windowsincluido en el instalador (build de UB Mannheim, Apache-2.0)incluidos
macOSbrew install tesseract (por ahora no va incluido)incluidos

La app busca Tesseract en este orden: la variable IUREOCR_TESSERACT, el que viene dentro del instalador, las rutas habituales del sistema y el PATH. En Ajustes se ve cuál encontró, su versión y los idiomas disponibles.

Es la cuarta app de escritorio de Iurefficient, junto a IureTranscribe, IureEditor e IureDav, y comparte con ellas la cuenta, el llavero y la sesión.

https://www.youtube-nocookie.com/embed/TgYELbFc5_A

Comentarios

comentarios

Eduardo Llaguno

Eduardo ha trabajado por 24 años en muy diversas áreas de TIC con amplia experiencia en administración de proyectos, nuevas tecnologías y como emprendedor.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *