Los pilotos de IA no mueren por culpa del modelo: mueren porque nunca llegaron a tocar el proceso real. El estudio del MIT no encontró retorno medible en el 95 % de las organizaciones analizadas, y el patrón que comparte el 5 % restante es siempre el mismo: caso acotado, cifra de partida medida antes de empezar, la IA ejecutándose dentro del flujo de trabajo, un camino definido para las excepciones y un dueño de negocio con presupuesto.
Las cifras: qué dicen el MIT y Gartner
El titular más repetido del último año procede del informe The GenAI Divide: State of AI in Business, de MIT NANDA, elaborado a partir de más de trescientas iniciativas revisadas, medio centenar de entrevistas y un centenar y medio de respuestas de directivos. Su conclusión: el 95 % de las organizaciones no obtuvo retorno medible de sus pilotos de IA generativa.
Conviene leerlo con precisión, porque el matiz es todo. No dice que las herramientas no funcionen. Dice que no se tradujeron en una cifra visible en la cuenta de resultados. La mayoría se quedó en mejoras de productividad individual —que alguien escriba antes su correo no aparece en ningún indicador— sin llegar nunca al proceso que factura, cobra o entrega.
Gartner apunta a lo mismo desde otro ángulo. En junio de 2025 previó que más del 40 % de los proyectos de IA agéntica se cancelarán antes de que acabe 2027, por costes crecientes, valor de negocio difuso o controles de riesgo insuficientes. Y dos meses después estimó que el 40 % de las aplicaciones empresariales incorporarán agentes especializados a finales de 2026, frente a menos del 5 % en 2025.
La IA se va a meter en todas partes y la mayoría de los proyectos que la persiguen como proyecto se van a cancelar. No es contradictorio: significa que la IA va a llegar incrustada en procesos y aplicaciones que ya funcionan, no como iniciativa independiente con su propio comité. El error caro es tratarla como un programa aparte.
Las cinco razones por las que muere un piloto
Ninguna tiene que ver con la calidad del modelo. Todas tienen que ver con el entorno en el que se le pidió trabajar.
- Vivía al lado del proceso, no dentro. El piloto era una pantalla aparte a la que había que subir documentos a mano y de la que había que copiar el resultado. Funciona con veinte casos de prueba y se abandona con doscientos, porque el trabajo de trasiego se come el ahorro.
- Nadie decidió qué pasa con lo raro. La IA acierta en el caso estándar; el valor está en qué ocurre con el 8 % que no lo es. Sin una regla explícita —a quién se deriva, con qué prioridad, con qué plazo— la excepción vuelve al correo y el proceso deja de ser un proceso.
- No había cifra de partida. Si no se midió cuánto tardaba y cuánto costaba el proceso antes, la mejora no se puede demostrar. Y lo que no se demuestra no se presupuesta al año siguiente. Este es el fallo más barato de evitar y el más frecuente.
- El dueño era técnico. Los pilotos que sobreviven los pide quien sufre el problema —el responsable de administración, el de compras, el de personas— porque es quien defiende el presupuesto cuando toca decidir. Un patrocinador de sistemas puede construirlo, pero no puede justificarlo.
- El coste por caso no se calculó a escala. Consumo de modelo, revisión humana, reintentos y mantenimiento son irrelevantes con cien documentos al mes y determinantes con cien mil. Merece la pena hacer ese cálculo en la calculadora de ROI antes de firmar nada, no después.
La investigación del MIT añade una causa de fondo que encaja con las cinco: los sistemas desplegados no aprenden del uso. No retienen el criterio del revisor, no se adaptan al contexto de la empresa y no mejoran con el tiempo. Empiezan con un acierto razonable y ahí se quedan, mientras el equipo esperaba una curva ascendente.
Qué separa una demo de un proceso en producción
La distancia entre las dos columnas de esta tabla es donde se pierde el 95 %. Merece la pena revisarla antes de la demo, no después.
| Dimensión | En la demo | En producción |
|---|---|---|
| Los datos | Veinte ejemplos elegidos, limpios y legibles. | Escaneos torcidos, faxes, fotos de móvil y el formato raro de un proveedor concreto. |
| La entrada | Alguien sube el fichero a mano. | Llega solo por correo, portal o integración, se identifica y se enruta sin intervención. |
| El error | Se comenta y se pasa al siguiente ejemplo. | Tiene un camino: se detecta, se deriva a una persona y se cierra con plazo. |
| La traza | No hace falta. | Quién decidió qué, con qué versión y con qué evidencia. Es lo que se enseña en una auditoría. |
| Los permisos | Un usuario que lo ve todo. | Cada usuario ve lo suyo; el asistente hereda esos permisos y no puede ampliarlos. |
| El coste | Irrelevante. | Céntimos por caso multiplicados por el volumen anual, más la revisión humana. |
Ninguna de las seis filas se resuelve con un modelo mejor. Todas se resuelven con un proceso alrededor del modelo: enrutado, excepciones, permisos, registro y medición. Es exactamente lo que hace un BPM, y es la razón por la que la IA que rinde suele estar montada encima de uno.
Agent washing: cómo saber si te venden un agente o un chatbot con nombre nuevo
Gartner puso nombre al fenómeno: agent washing, la práctica de reetiquetar como agentes de IA productos que ya existían —asistentes, robots de RPA, chatbots de reglas—. Su estimación, en la misma nota en la que anticipa las cancelaciones, es contundente: de los miles de proveedores que se presentan como agénticos, solo unos 130 lo son realmente.
Cuatro preguntas bastan para separar el grano de la paja en una reunión comercial:
- ¿Decide o solo responde? Un agente elige entre varios caminos posibles según el estado del caso. Si el recorrido está fijado de antemano, es un flujo con lenguaje natural encima — perfectamente útil, pero no es lo mismo ni debería costar lo mismo.
- ¿Actúa sobre algún sistema real? Que escriba en el ERP, genere el asiento, cree el expediente. Si solo devuelve texto para que una persona lo copie, el ahorro se lo queda el copiado.
- ¿Deja traza de por qué hizo lo que hizo? Sin registro de decisión no hay auditoría posible, y sin auditoría no hay despliegue en un proceso regulado.
- ¿Dónde está el freno? Qué no puede hacer nunca, qué importe dispara una validación humana, quién revoca sus permisos. Si la respuesta es vaga, el control de riesgos no existe — y es una de las tres causas de cancelación que cita Gartner.
Hemos desarrollado el marco completo en agentes de IA gobernados por BPM y la comparación de arquitecturas en orquestación agéntica frente a BPM tradicional.
Comprar o construir: el dato incómodo
Es la decisión que más tiempo consume en los comités y la que el estudio del MIT responde con menos ambigüedad: los despliegues apoyados en proveedores especializados tuvieron aproximadamente el doble de tasa de éxito que los desarrollos internos.
No es una cuestión de talento. Es de alcance. Cuando una empresa decide construir, no está construyendo «una llamada a un modelo»; está asumiendo también la evaluación continua, la gestión de versiones, el control de accesos, la trazabilidad, el tratamiento de excepciones y la migración cuando el modelo que usa quede obsoleto en dieciocho meses. Ese trabajo no aparece en la estimación inicial y es el que acaba consumiendo el equipo.
La regla práctica: construye lo que te diferencia, compra lo que te cuesta. Un modelo de riesgo propio con datos que solo tú tienes puede justificar el esfuerzo. Clasificar facturas de proveedor, extraer campos de un albarán o enrutar correspondencia entrante, no: eso ya es una función de producto, y cuesta menos que el primer mes del desarrollo.
Los siete filtros antes de aprobar el siguiente piloto
Si un piloto no pasa los siete, no es que vaya a salir mal: es que no se va a poder demostrar que salió bien. Que es peor.
- Dueño de negocio con nombre. La persona que sufre el problema hoy y defenderá el presupuesto mañana.
- Cifra de partida medida. Casos al mes, minutos por caso, coste por caso y tasa de error actual. Antes de tocar nada.
- Criterio de éxito acordado por escrito. Un número y una fecha: «reducir de 9 a 3 días el cierre del expediente, antes del 30 de noviembre».
- Datos reales y feos. Los casos del último trimestre tal como llegaron, incluidos los tres proveedores que mandan la factura en formatos imposibles.
- Camino definido para las excepciones. A quién va, con qué plazo, con qué prioridad. Sin esto no hay producción posible.
- Integración pactada desde el primer día. De dónde entra el caso y a dónde sale el resultado. Si la respuesta es «lo vemos en la fase dos», la fase dos no llega.
- Fecha de cierre. Entre cuatro y ocho semanas, con decisión binaria: pasa a producción con presupuesto, o se cierra y se documenta lo aprendido.
El séptimo filtro es el que más incomoda y el que más valor tiene. Un piloto sin fecha de cierre no fracasa nunca: se queda en un limbo indefinido consumiendo atención, que es exactamente lo que describe el 95 %.
Cómo lo resuelve Dokuflex: la IA como paso del proceso, no como proyecto
Nuestra posición es la que sostienen los datos: el problema casi nunca es el modelo, es todo lo que tiene alrededor. Por eso en Dokuflex BPM low-code la IA no es un producto aparte, es un tipo de tarea dentro del flujo.
- El caso entra solo. Correo, portal, integración o captura desde el gestor documental. No hay nadie subiendo ficheros a una pantalla aparte, que es la primera causa de abandono.
- La excepción ya tiene camino. Si la confianza no llega al umbral o el importe supera el límite, el expediente se deriva a la persona correspondiente con su plazo. El enrutamiento es parte del flujo, no una tarea pendiente.
- La medición viene de serie. Cada paso queda registrado con su marca de tiempo, así que la comparación entre el antes y el después no hay que montarla: se lee. Es el mismo rastro que explota la minería de procesos.
- Cambiar es configurar. Ajustar un umbral, añadir una validación o cambiar el destinatario de una excepción es editar el proceso y publicar la versión. Ese ciclo corto es lo que permite llegar a la semana ocho con resultados en vez de con un informe de situación. Lo contamos en cómo reducir los plazos de implantación.
Y el procesamiento inteligente de documentos resuelve la fila más ingrata de la tabla anterior: los documentos feos de verdad, los que hunden los pilotos montados sobre veinte PDF perfectos.
Pide una demo con tus propios documentos, no con los nuestros →
Cómo elegir el primer caso
El instinto lleva a elegir el proceso más vistoso. Conviene resistirlo: el primer caso no está para impresionar, está para demostrar que el ciclo completo funciona en tu organización. Cuatro condiciones:
- Volumen alto y repetitivo. Sin volumen no hay ahorro visible, por buena que sea la tecnología.
- Reglas claras. Si dos expertos internos no se ponen de acuerdo en qué es correcto, el problema no es de IA.
- Error tolerable y reversible. Un campo mal extraído que se corrige en revisión, no una decisión que llega al cliente sin filtro.
- Histórico disponible. Lo que permite comparar contra la cifra de partida y cerrar la discusión con datos.
Registro de facturas de proveedor, clasificación de correspondencia entrante, comprobación documental de un alta de cliente. Casos aburridos, y por eso ganan. Si quieres ponerles precio antes de empezar, cuánto cuesta automatizar un proceso desglosa las partidas; y si el debate en tu empresa es entre IA, BPM o robots, BPM low-code frente a RPA lo ordena.
Preguntas frecuentes
¿Es cierto que el 95 % de los pilotos de IA fracasan? +
El dato procede del informe The GenAI Divide: State of AI in Business 2025, de MIT NANDA, y conviene leerlo con precisión: no dice que el 95 % de los pilotos no funcione técnicamente, dice que el 95 % de las organizaciones no obtuvo un retorno medible en la cuenta de resultados. La diferencia importa, porque el fallo no está en el modelo sino en el salto del experimento al proceso que factura, cobra o entrega.
¿Por qué muere un piloto de IA que funcionaba bien en la demo? +
Por cinco motivos que se repiten: el piloto vivía al lado del proceso y no dentro de él, así que alguien tenía que copiar y pegar; nadie definió qué pasaba con las excepciones; no había una cifra de referencia previa, con lo que fue imposible demostrar la mejora; no había dueño de negocio, solo un patrocinador técnico; y el coste por caso, irrelevante con cien documentos, dejó de serlo con cien mil.
¿Qué es el agent washing? +
Es la práctica de rebautizar como «agente de IA» un producto que ya existía: un asistente conversacional, un robot de RPA o un chatbot con reglas. Gartner la señaló en junio de 2025 al advertir de que más del 40 % de los proyectos de IA agéntica se cancelarán antes de que acabe 2027, y estimó que de los miles de proveedores que se presentan como agénticos solo unos 130 lo son de verdad. La prueba práctica: si no puede decidir entre varios caminos, actuar sobre un sistema real y dejar traza de por qué lo hizo, no es un agente.
¿Conviene comprar una solución de IA o construirla en casa? +
La investigación del MIT apunta en una dirección clara: los despliegues apoyados en proveedores especializados tuvieron aproximadamente el doble de éxito que los desarrollos internos. El motivo no es la calidad del equipo propio, sino el alcance: construir implica asumir también la evaluación, la supervisión, el versionado, la trazabilidad y el mantenimiento cuando cambie el modelo. Para un caso de uso diferencial puede compensar; para clasificar facturas, no.
¿Cuánto debería durar un piloto de IA? +
Entre cuatro y ocho semanas. Si tarda más, casi siempre es porque se ha convertido en un proyecto de integración disfrazado de prueba. Un piloto bien planteado empieza con una cifra de partida medida antes de tocar nada, se ejecuta sobre casos reales del último trimestre y termina con una decisión binaria: pasa a producción con su dueño y su presupuesto, o se cierra.
¿Qué hay que medir para saber si un piloto de IA ha funcionado? +
Cuatro cifras y ninguna de ellas es la precisión del modelo: tiempo total del caso de principio a fin frente a la cifra previa; porcentaje de casos que se completan sin intervención humana; tasa de error que llega al cliente final; y coste por caso, incluyendo consumo del modelo, revisión humana y mantenimiento. La precisión es un indicador interno; estas cuatro son las que entiende un comité de dirección.
¿Por dónde conviene empezar con la IA en procesos? +
Por un proceso de alto volumen, con reglas claras, con documentos de entrada repetitivos y con un coste de error tolerable y reversible: registro de facturas de proveedor, clasificación de correspondencia, comprobación documental de un alta. Son casos aburridos, y por eso funcionan: hay datos históricos para comparar, hay una cifra previa que mejorar y un fallo se detecta y se corrige sin consecuencias graves.
Fuentes
- MIT NANDA — The GenAI Divide: State of AI in Business 2025 (PDF): ausencia de retorno medible en el 95 % de las organizaciones, brecha de aprendizaje y ventaja de los despliegues con proveedor especializado.
- Gartner, 25 de junio de 2025: más del 40 % de los proyectos de IA agéntica se cancelarán antes de finales de 2027; definición de agent washing.
- Gartner, 26 de agosto de 2025: el 40 % de las aplicaciones empresariales incorporarán agentes especializados a finales de 2026.
Empieza por el número, no por la demo
Calcula en 60 segundos qué te cuesta hoy el proceso que quieres automatizar. Sin email y sin comercial. Con esa cifra encima de la mesa, cualquier conversación posterior —con nosotros o con quien sea— se vuelve mucho más corta.