Documentation Index

Fetch the complete documentation index at: https://knowledgecenter.docuware.com/llms.txt

Use this file to discover all available pages before exploring further.

Introducción al procesamiento inteligente de documentos

Prev Next

DocuWare Intelligent Document Processing (IDP) utiliza inteligencia artificial para procesar sus documentos. Esto incluye la división, la clasificación y la extracción de datos para la indexación de documentos.

El procesamiento de documentos y, en especial, la indexación constituyen la base de todos los procesos con DocuWare. La normativa legal exige documentos perfectamente indexados; la búsqueda de documentos y los procesos de negocio se basan en los datos de índice de los documentos y pueden agilizarse una vez extraídos los datos. Valores de índice como el número de factura, el nombre del proveedor o la fecha de un contrato son los que convierten un archivo almacenado en un registro localizable y operativo. IDP asume este trabajo: lee el contenido del documento, identifica la información relevante y la escribe en sus campos de índice de DocuWare.

El problema que resuelve IDP

La mayoría de los documentos empresariales no están estructurados. Llegan como PDF escaneados, archivos adjuntos de correo electrónico o páginas fotografiadas, y cada proveedor da formato a los documentos de manera diferente. La información que necesita se encuentra en algún lugar de la página, pero no en una estructura de datos predecible. Extraer datos útiles de estos archivos a mano es lento, repetitivo y propenso a errores. Los enfoques tradicionales de automatización intentan resolverlo mediante plantillas fijas, pero estas fallan cada vez que un proveedor cambia su diseño o aparece un nuevo tipo de documento.

IDP adopta un enfoque diferente. En lugar de basarse en reglas rígidas, utiliza inteligencia artificial que aprende de sus documentos reales. La IA reconoce los tipos de documento, encuentra los campos relevantes y gestiona las variaciones de diseño, idioma y calidad de escaneo sin necesidad de una plantilla independiente para cada proveedor o formato. El resultado es un proceso de tratamiento que se adapta a sus documentos en lugar de obligarlos a encajar en una estructura fija.

Información: estructurado frente a no estructurado

Los datos estructurados residen en un esquema claramente definido: una base de datos, una hoja de cálculo o un XML. Cada elemento de información tiene un lugar fijo y un formato conocido. Los datos no estructurados son todo lo demás. Una factura escaneada es no estructurada porque el número de factura puede aparecer en la esquina superior derecha del documento de un proveedor y en el centro de la página en el de otro. Lo mismo ocurre con los contratos, los albaranes de entrega y la mayoría de la correspondencia comercial. La información está ahí, pero su posición varía de un documento a otro.

Cómo procesa IDP un documento

Cada documento que entra en IDP pasa por la misma secuencia de pasos. El proceso se ejecuta automáticamente en segundo plano y, en la mayoría de las configuraciones, no se requiere ninguna intervención del usuario. Si su proceso requiere una verificación humana, por ejemplo durante las primeras etapas de una nueva configuración de IDP o para documentos de alto riesgo, puede añadir un paso de verificación opcional en el que un usuario revise y corrija los valores extraídos antes del archivado.

Preprocesamiento, división y clasificación

El recorrido comienza con el preprocesamiento: IDP prepara el archivo entrante ejecutando el reconocimiento óptico de caracteres (OCR), corrigiendo la calidad de la imagen y alineando las páginas. El objetivo es generar una entrada limpia y legible, independientemente de cómo se haya capturado el documento.

A continuación viene la división. En muchos escenarios reales, los documentos no llegan de uno en uno. Un operador de escáner puede introducir una pila de 15 facturas en un dispositivo y generar un único PDF. IDP detecta dónde termina un documento y dónde empieza el siguiente, sin códigos de barras ni páginas separadoras, y divide el archivo en documentos individuales que pueden procesarse por separado.

Una vez separados los documentos, entra en juego la clasificación. IDP examina cada documento y determina de qué tipo se trata: una factura, un albarán de entrega, un contrato, un pedido de compra o cualquier clase de documento que haya definido para su organización. Este paso es lo que permite a IDP extraer el contenido y archivar cada documento.

Extracción y archivado

Una vez identificado el tipo de documento, IDP pasa a extraer el contenido propiamente dicho. Cada documento contiene fragmentos de información relevantes para su proceso de negocio. En una factura, por ejemplo, son el número de factura, la fecha, el nombre del proveedor y el importe total. En un contrato, pueden ser el ID del contrato, la fecha de entrada en vigor y las partes implicadas. En la terminología de IDP, cada uno de estos fragmentos de información se denomina campo. Usted decide qué campos debe buscar IDP.

IDP localiza estos campos en el documento, lee sus valores y los escribe en los campos de índice correspondientes de DocuWare. Una vez completado este paso, el documento se puede buscar y está listo para procesos posteriores.

Por último, el documento totalmente indexado se almacena en el archivador de destino. Si hay un flujo de trabajo configurado, por ejemplo un proceso de aprobación de facturas, este se inicia automáticamente en cuanto llega el documento. Desde la perspectiva del usuario, los documentos simplemente aparecen en el lugar adecuado con los metadatos correctos, como si alguien los hubiera archivado manualmente.

Tipos de modelos de IA

IDP se basa en tres tipos de modelos de IA, cada uno responsable de uno de los pasos principales de procesamiento descritos anteriormente. En DocuWare, estos modelos también se denominan agentes.

  • Los modelos de división detectan los límites entre documentos dentro de un archivo de varias páginas. Trabajan únicamente a partir del contenido y reconocen cuándo el texto, el diseño o la estructura cambian de un documento a otro. No requieren códigos de barras, páginas en blanco ni un número fijo de páginas. Esto los hace especialmente útiles en escenarios de sala de correo en los que los operadores escanean pilas mixtas de papel sin clasificarlas previamente.

  • Los modelos de clasificación asignan cada documento a una clase de documento que usted defina. Estas clases pueden ser tan amplias o tan específicas como necesite su organización. Una configuración sencilla puede distinguir entre «Factura», «Albarán de entrega» y «Otros». Una configuración más avanzada puede diferenciar entre «Factura nacional», «Factura internacional», «Nota de crédito» y «Factura proforma». El modelo aprende a partir de ejemplos, por lo que, a medida que cambia su combinación de documentos con el tiempo, la clasificación puede evolucionar con ella.

  • Los modelos de extracción se encargan de la extracción detallada de datos. Usted define qué campos debe extraer el modelo: número de factura, fecha, partidas, totales o cualquier otra información relevante para su proceso. El modelo encuentra estos valores incluso cuando los diseños varían entre proveedores o cuando la calidad del escaneo es deficiente. Imagine un equipo financiero que procesa facturas de 200 proveedores diferentes. En lugar de mantener una plantilla para cada uno, un único modelo de extracción se ocupa de todas ellas.

Cómo obtener sus modelos

No tiene que crear cada modelo desde cero. Según su escenario, puede elegir entre varias vías y combinarlas dentro de la misma configuración de IDP.

Modelos predefinidos

Para los casos de uso habituales, hay modelos predefinidos disponibles de forma inmediata. Estos cubren escenarios como la extracción estándar de facturas o la división básica de documentos y no requieren entrenamiento ni configuración. Si sus documentos siguen formatos ampliamente utilizados, un modelo predefinido puede ser todo lo que necesite para empezar.

Modelos entrenados a partir de archivadores de DocuWare

Si ya dispone de un gran volumen de documentos archivados en DocuWare, puede utilizarlos como datos de entrenamiento. Los modelos de IDP pueden entrenarse directamente desde DocuWare Configuraciones > DocuWare IDP. Seleccione los archivadores que contienen sus documentos de entrenamiento, inicie el entrenamiento y los modelos resultantes se ajustarán a los formatos, diseños y contenido específicos de sus archivos reales. El entrenamiento puede tardar hasta 24 horas, pero no es necesario que espere. Puede seguir configurando su flujo de trabajo mientras tanto.

Modelos personalizados en la plataforma IDP

Para requisitos especializados o complejos, puede crear modelos totalmente personalizados en la plataforma IDP independiente. Esta plataforma admite cualquier tipo de documento, estén o no archivados en DocuWare, y suele utilizarse con la ayuda de su socio o contacto de DocuWare.

  1. Los modelos personalizados pueden crearse de dos maneras. El enfoque clásico: usted carga documentos de muestra, marca los campos relevantes, entrena el modelo y revisa los resultados. Este método requiere más tiempo y esfuerzo, pero ofrece una precisión muy alta.

  2. El enfoque Gen AI funciona de forma diferente y combina una configuración sencilla con una precisión alta. Antes de anotar los documentos, usted describe qué debe extraer el modelo mediante instrucciones en lenguaje natural; por ejemplo, «Extraer el número de factura», «Devolver solo la parte del dominio de la dirección de correo electrónico» o «Buscar la fecha de entrega en el área del encabezado». El modelo empieza a funcionar de inmediato, sin ninguna fase de entrenamiento. Esto lo convierte en una buena opción para muchos casos de uso sencillos, así como para pruebas de concepto o situaciones en las que necesita resultados rápidamente. También es una buena opción si desea entrenar el modelo mientras trabaja con los documentos y validarlos durante el almacenamiento.
    El modelo aún puede entrenarse con datos de entrenamiento, perfeccionarse y probarse para alcanzar la mayor precisión posible.

Dónde encaja IDP en su flujo de documentos

IDP procesa los documentos en el punto en el que entran en DocuWare. Los dos puntos de entrada más habituales son la importación por correo electrónico y las DocuWare Desktop Apps.

  • Importación por correo electrónico:
    para la importación por correo electrónico, configura DocuWare para que supervise un buzón e importe automáticamente los mensajes entrantes. Cuando añade una configuración de IDP a este escenario, cada PDF adjunto se clasifica e indexa antes de llegar al archivador. Un ejemplo típico es un buzón de cuentas por pagar que recibe decenas de PDF de facturas al día. IDP clasifica cada archivo adjunto, extrae los campos clave y archiva el documento sin intervención manual. Más información sobre cómo configurar IDP para la importación por correo electrónico.

  • DocuWare Desktop Apps:
    para DocuWare Desktop Apps, los documentos añadidos a través de los complementos Scan o Import pasan por el mismo proceso de IDP. Las facturas en papel capturadas con DocuWare Scan y los archivos PDF existentes incorporados a través del complemento Import se dividen, clasifican, indexan y archivan automáticamente. Más información sobre cómo configurar IDP para DocuWare Desktop Apps.

Preguntas frecuentes

¿Qué precisión puedo esperar?

La precisión depende de varios factores: la calidad de sus escaneos, la variedad de diseños de documentos y si utiliza un modelo predefinido, basado en instrucciones o entrenado con anotaciones. Los modelos predefinidos funcionan bien con documentos estándar. Los modelos personalizados entrenados con datos anotados suelen alcanzar la mayor precisión. En general, cuanto más representativos sean sus datos de entrenamiento, mejores serán los resultados. No hay una cifra universal, pero puede supervisar las puntuaciones de confianza a lo largo del tiempo y ajustar su configuración en consecuencia.

¿Qué formatos de documento e idiomas se admiten?

IDP procesa archivos PDF, que es el formato más habitual para los documentos empresariales escaneados y enviados por correo electrónico. Los documentos en otros formatos, como TIFF o JPEG, se convierten durante el preprocesamiento. IDP admite varios idiomas. El conjunto exacto de idiomas admitidos depende del modelo y de la configuración. Póngase en contacto con su socio de DocuWare para obtener información sobre su escenario específico.

¿Cuánto tarda en ponerse en producción un modelo personalizado?

Con el enfoque GenAI, puede empezar a extraer datos en cuestión de minutos. No hay fase de entrenamiento. En los modelos basados en anotaciones, el plazo depende de cuántos documentos anote y de cuán variados sean sus diseños de documentos. El entrenamiento en sí puede tardar hasta 24 horas una vez iniciado. En la práctica, pasar de la primera anotación a un modelo listo para producción suele ser cuestión de días, no de semanas.

¿Puedo volver a entrenar un modelo cuando cambian los diseños de los documentos?

Sí. Si un proveedor cambia el formato de sus facturas o aparece un nuevo tipo de documento, puede actualizar los modelos existentes con datos de entrenamiento adicionales. No es necesario crear un nuevo modelo desde cero. En el caso de los modelos entrenados a partir de archivadores de DocuWare, puede iniciar una nueva ejecución de entrenamiento que incluya los documentos actualizados.

Versiones compatibles: DocuWare Cloud