Para preparar datos para IA en una empresa no hace falta reunir toda la información histórica ni hacer una limpieza general de todos los sistemas. El primer paso es elegir un proceso concreto, definir qué tarea o decisión se quiere apoyar y revisar si los datos disponibles son adecuados para ese objetivo.
Por ejemplo, los datos necesarios para asistir en la búsqueda de procedimientos internos no son los mismos que para clasificar correos, prever una demanda o conectar un agente a un ERP. La calidad no es una propiedad absoluta del dato: debe evaluarse según la finalidad prevista y el contexto real de uso.
Entonces, ¿cómo saber si tus datos sirven para IA? Deben ser relevantes para el proceso elegido, suficientemente fiables y actuales para probar la solución, trazables hasta su origen y utilizables con los permisos y controles necesarios. La respuesta definitiva no llega antes de probar el caso de uso con ejemplos representativos y supervisión adecuada.
Antes de tocar los datos: define qué proceso quieres mejorar
Empieza por redactar una descripción breve y operativa del caso de uso. Debe responder a cinco preguntas:
- ¿Qué tarea o decisión quieres mejorar? Por ejemplo, localizar documentación, ordenar solicitudes o proponer una prioridad.
- ¿Qué resultado esperas de la solución? Define una salida concreta: una respuesta con fuentes, una categoría, un borrador o una alerta para revisión.
- ¿Quién usará esa salida? Identifica al equipo y a la persona que podrá validar si es útil.
- ¿Dónde están los datos que necesita el proceso? No des por hecho que todo está en una única aplicación.
- ¿Cómo comprobarás el resultado? Establece ejemplos de prueba y criterios de aceptación antes de implantar nada.
Este enfoque evita invertir tiempo en datos que no aportarán valor al caso elegido. También ayuda a decidir si basta una herramienta existente configurada con documentación y reglas, o si el proyecto necesita una solución más específica. Entrenar o desarrollar un modelo propio suele exigir una preparación, etiquetado, evaluación y control técnico más exigentes.
Si todavía estás identificando dónde puede aportar valor la tecnología, revisa Procesos empresariales que puedes automatizar con inteligencia artificial.
Haz un inventario de fuentes y responsables
Una pyme puede tener información relevante repartida entre ERP, CRM, hojas de cálculo, bases de datos, aplicaciones sectoriales, formularios, tickets, correo electrónico y archivos PDF. Localiza primero las fuentes relacionadas con el proceso seleccionado, sin intentar abarcar toda la organización.
Para cada fuente, anota al menos:
- qué información contiene y para qué se utiliza hoy;
- el área o persona propietaria del dato;
- el periodo histórico disponible;
- la frecuencia con la que se actualiza;
- los usuarios y sistemas que tienen acceso;
- si contiene datos personales o información confidencial;
- las incidencias conocidas, como duplicados, campos libres o archivos sin fecha.
Revisa los datos maestros compartidos
Clientes, productos, proveedores, tarifas, centros, estados y códigos suelen aparecer en más de un sistema. Si cada aplicación usa identificadores distintos o nombres escritos de formas diferentes, la IA puede recibir información incompleta o contradictoria.
Conviene determinar qué sistema es la fuente principal de cada dato maestro y qué identificador permite relacionarlo con los demás. No siempre será necesario unificar todos los sistemas antes de hacer una prueba, pero sí conocer las diferencias que afectan al caso de uso.
Saber dónde se encuentra un archivo no implica que pueda utilizarse sin más en una solución de IA. Los permisos de acceso, la finalidad del tratamiento y las condiciones del proveedor también forman parte de la preparación.
Perfilado: qué revisar en cada conjunto de datos
El perfilado consiste en observar cómo son realmente los datos antes de conectarlos a una herramienta o construir una integración. No se trata de alcanzar un porcentaje universal de calidad: los umbrales aceptables dependen de la tarea, del daño que pueda causar un error y de las alternativas de revisión humana.
Como referencia, revisa estas dimensiones:
| Dimensión | Qué comprobar | Posible impacto operativo |
|---|---|---|
| Exactitud | Si el dato refleja una situación real y verificable. | Una fecha errónea puede cambiar una prioridad o una respuesta. |
| Completitud | Campos vacíos, documentos incompletos o periodos sin datos. | La solución puede no disponer del contexto necesario. |
| Consistencia | Formatos, categorías, unidades y códigos equivalentes. | Una clasificación puede tratar como distintos conceptos iguales. |
| Actualidad | Fecha de actualización y vigencia de reglas o documentos. | Las respuestas pueden basarse en procedimientos obsoletos. |
| Relevancia | Si la información sirve para la tarea definida. | Más datos irrelevantes pueden añadir ruido, no valor. |
| Trazabilidad | Origen, cambios y transformaciones aplicadas. | Será difícil revisar o corregir una salida discutible. |
| Representatividad | Si los ejemplos reflejan condiciones reales de uso. | El sistema puede fallar cuando cambien clientes, productos o procesos. |
NIST destaca la validez, la fiabilidad, la robustez y la representatividad como características relevantes para gestionar riesgos en sistemas de IA. También recomienda documentar cómo se recopilan, seleccionan y evalúan los datos, sus limitaciones y las medidas correctoras previstas. Puedes consultar estos criterios en el marco de características de confianza de NIST y en su guía de medición.
Registra y prioriza las incidencias
Para una primera revisión no hace falta una plataforma compleja. Puedes utilizar una tabla de trabajo para registrar las incidencias detectadas y decidir cuáles corregir antes de la prueba.
| Fuente o campo | Incidencia | Impacto en el caso de uso | Responsable | Acción prevista | Prioridad y estado |
|---|---|---|---|---|---|
| Ejemplo: estado de pedido | Dos equipos usan categorías distintas para la misma situación. | Puede producir clasificaciones o prioridades inconsistentes. | Responsable del proceso | Definir categorías válidas y normalizar los valores necesarios. | Prioridad según el riesgo; pendiente, en revisión o resuelto. |
La prioridad debe responder al impacto de la incidencia en la decisión o tarea que se quiere apoyar, no solo al número de errores detectados. Una anomalía poco frecuente puede requerir atención inmediata si afecta a una decisión sensible; un campo incompleto puede ser asumible si no interviene en la prueba.
Incidencias que merece la pena detectar pronto
- Valores ausentes en campos relevantes para la tarea.
- Clientes, productos o proveedores duplicados.
- Fechas imposibles, sin zona temporal o escritas en formatos mezclados.
- Unidades diferentes para el mismo concepto.
- Categorías, estados o códigos que cambian según el departamento.
- Relaciones rotas entre tablas o registros sin identificador.
- Información histórica que ya no representa productos, mercados o reglas actuales.
Un conjunto muy completo puede seguir siendo poco útil si mide mal lo que se quiere analizar o si no representa la situación actual. Por eso, antes de corregir masivamente los datos, prioriza las incidencias que cambian el resultado del caso de uso.
Prepara documentos y texto para una IA
En asistentes internos, búsqueda documental o procesamiento de archivos, el reto no suele ser solo disponer de PDFs. Hay que poder localizar el contenido correcto, saber de dónde procede y limitar quién puede consultarlo.
Antes de incorporar documentos, revisa:
- Extracción de texto: los documentos escaneados pueden requerir OCR, y el texto extraído debe contrastarse con el original cuando sea relevante.
- Clasificación: separa contratos, procedimientos, fichas, incidencias y otros tipos documentales si tienen usos, propietarios o permisos distintos.
- Metadatos: registra título, fecha, área, tipo de documento, estado de vigencia y, cuando aplique, cliente o proceso relacionado.
- Versiones: identifica cuál es la versión válida y retira o marca la documentación obsoleta.
- Trazabilidad: conserva la relación entre un fragmento utilizado por la IA y el documento de origen.
- Permisos: no mezcles en una misma base documental contenidos que deben tener niveles de acceso incompatibles.
El OCR, las etiquetas creadas automáticamente y los datos sintéticos pueden contener errores. Deben validarse antes de usarlos como referencia de negocio o como material de entrenamiento.
Crea una ficha sencilla para cada conjunto de datos
No necesitas empezar con una plataforma compleja de gobierno del dato. Una ficha mantenida en un documento compartido puede dar trazabilidad suficiente para una primera prueba controlada.
Incluye estos campos:
- nombre del conjunto de datos o fuente;
- finalidad concreta dentro del caso de uso;
- propietario del dato y responsable técnico;
- origen, periodo cubierto y frecuencia de actualización;
- campos clave, identificadores y relaciones con otras fuentes;
- datos personales, confidenciales o categorías especialmente sensibles;
- qué pretende medir o representar cada campo relevante;
- limpieza, normalizaciones y transformaciones aplicadas;
- incidencias y limitaciones conocidas;
- reglas de validación, permisos y personas autorizadas.
Esta ficha permite explicar qué se ha usado, detectar qué ha cambiado y repetir la revisión si se modifican los sistemas, los productos, las reglas internas o el proceso.
Valida con las personas que conocen el proceso
Una estructura técnicamente ordenada no garantiza que los datos representen el trabajo real. Involucra a responsables de operaciones, administración, ventas o atención al cliente para revisar ejemplos concretos.
Pídeles que comprueben si las categorías, estados, etiquetas y excepciones significan lo mismo en la práctica que en los sistemas. Esta revisión puede revelar, por ejemplo, que un estado se usa de forma distinta por dos equipos o que un campo aparentemente obligatorio se rellena con texto de relleno.
Después, prepara un conjunto de prueba representativo: casos habituales, excepciones conocidas y ejemplos recientes. Define qué debe hacer la solución, qué resultados requieren corrección y cuándo debe escalar el caso a una persona. La calidad de los datos por sí sola no demuestra que una IA vaya a ser precisa, rentable o apropiada; es necesario probarla en condiciones cercanas al uso previsto y mantener controles proporcionales al riesgo.
Cuando los datos ya estén revisados para un caso concreto, el siguiente paso es plantear la integración, la prueba y la supervisión necesarias. Puedes ampliar ese proceso en Cómo integrar la inteligencia artificial en una empresa paso a paso.
Privacidad, accesos y límites regulatorios
Cuando el conjunto incluye datos personales, preparar los datos también implica revisar si el tratamiento tiene una finalidad determinada, explícita y legítima; si se limita a lo necesario; si los datos son exactos y se mantienen actualizados cuando procede; y si se conservan durante un plazo justificado. Son principios recogidos en el artículo 5 del Reglamento General de Protección de Datos.
No cargues bases de clientes, nóminas, contratos, historiales, conversaciones u otros documentos confidenciales en una herramienta externa sin revisar previamente las condiciones de tratamiento, conservación, subencargados, posibles transferencias, controles de acceso y configuración del servicio. Eliminar identificadores o aplicar seudonimización puede reducir riesgos, pero no reemplaza el análisis de finalidad, legitimación, seguridad, permisos y conservación.
El Reglamento de IA de la Unión Europea prevé requisitos específicos de gobernanza y gestión de datos para determinados sistemas de alto riesgo que usen técnicas de entrenamiento con datos. Su artículo 10 menciona cuestiones como el origen, la recopilación, el etiquetado, la limpieza, la actualización y las hipótesis sobre lo que los datos representan. No es una obligación general aplicable automáticamente a cualquier uso de IA de una pyme; la aplicación concreta depende del sistema y de su categoría regulatoria. Consulta el texto aplicable en EUR-Lex.
Si la IA puede influir en contratación, crédito, evaluación de trabajadores, acceso a servicios, salud, seguridad u otras decisiones de impacto relevante, conviene una revisión jurídica, técnica y organizativa específica antes de implantarla. Para tratamientos con datos personales o sensibles, recurre a un profesional de privacidad o al delegado de protección de datos cuando corresponda.
Decide si estás listo para una prueba acotada
Tu empresa está en condiciones de plantear una prueba acotada cuando puedes marcar estos puntos:
- Existe un proceso y un objetivo operativo bien definidos.
- Las fuentes necesarias están localizadas y tienen un responsable identificado.
- Se conocen los problemas de calidad que afectan al caso de uso y se han fijado criterios aceptables para ese contexto.
- Los datos maestros relevantes tienen identificadores y reglas suficientemente coherentes.
- Los documentos disponen de texto verificable, metadatos, versiones y permisos adecuados.
- Se han revisado los datos personales y confidenciales, los accesos y las condiciones de los proveedores implicados.
- Hay un conjunto de prueba representativo y personas del negocio disponibles para validarlo.
- Se han definido criterios de aceptación, revisión humana, corrección de errores y seguimiento posterior.
Si faltan varios elementos, no significa que la IA esté descartada. Indica que el siguiente paso debería ser un diagnóstico de datos o una prueba más limitada, no una implantación completa. Preparar lo justo para un objetivo concreto permite aprender con control y decidir después qué datos, integraciones o reglas merece la pena reforzar.
Preguntas frecuentes
¿Cuántos datos necesita una pyme para empezar con IA?
No existe un volumen mínimo universal. Depende del caso de uso y de la tecnología elegida. Para una búsqueda documental puede ser suficiente una colección limitada de documentos vigentes, bien clasificados y con permisos claros. Para entrenar un modelo propio de clasificación o predicción suelen hacer falta más ejemplos representativos, etiquetados y evaluados. Lo importante es que los datos sean relevantes para la tarea y permitan realizar una prueba realista.
¿Es obligatorio limpiar todos los datos antes de usar una herramienta de IA?
No. Conviene limpiar y normalizar los datos que afectan al proceso concreto que se quiere mejorar. Una limpieza general sin objetivo puede consumir recursos sin aportar valor. Prioriza duplicados, valores ausentes, categorías inconsistentes, documentos obsoletos y errores que puedan alterar el resultado de la prueba.
¿Qué diferencia hay entre preparar datos para búsqueda documental y entrenar un modelo propio?
En una búsqueda documental, la prioridad suele estar en la vigencia de los documentos, la extracción de texto, los metadatos, los permisos y la trazabilidad hasta la fuente original. Para entrenar un modelo propio normalmente se requiere, además, un conjunto de ejemplos representativos, etiquetas fiables, evaluación técnica y seguimiento del rendimiento tras el despliegue.
¿Puedo utilizar datos de clientes en una herramienta externa de IA?
Depende de la finalidad, la legitimación, el tipo de datos y las condiciones del proveedor. Antes de hacerlo hay que revisar los principios del RGPD, los permisos, las medidas de seguridad, la conservación, los subencargados, las posibles transferencias y la configuración del servicio. La seudonimización o la eliminación de identificadores puede reducir riesgos, pero no sustituye ese análisis.
¿Cómo sé si mis datos históricos siguen representando el negocio actual?
Compáralos con casos recientes y revísalos con las personas que ejecutan el proceso. Comprueba si han cambiado productos, clientes, mercados, tarifas, procedimientos, categorías o reglas internas. Prepara un conjunto de prueba con ejemplos actuales y revisa de nuevo los datos cuando cambien las condiciones de uso.
¿Quieres valorar si tus datos permiten una prueba de IA?
Revisamos el objetivo, las fuentes disponibles, la integración y la supervisión necesaria para plantear un caso de uso acotado.


