Les pilotes d'IA ne meurent pas à cause du modèle : ils meurent parce qu'ils n'ont jamais touché le processus réel. L'étude du MIT n'a trouvé aucun retour mesurable dans 95 % des organisations analysées, et le schéma partagé par les 5 % restants est toujours le même : un cas circonscrit, une valeur de référence mesurée avant de commencer, l'IA exécutée dans le flux, un chemin défini pour les exceptions, et un propriétaire métier doté d'un budget.
Les chiffres : ce qu'ont trouvé le MIT et Gartner
Le titre le plus repris de l'année dernière vient du rapport The GenAI Divide: State of AI in Business, de MIT NANDA, bâti sur plus de trois cents initiatives examinées, une cinquantaine d'entretiens et environ cent cinquante réponses de dirigeants. Sa conclusion : 95 % des organisations n'ont obtenu aucun retour mesurable de leurs pilotes d'IA générative.
La lecture doit être précise, car la nuance est déterminante. Il n'est pas dit que les outils ne fonctionnent pas. Il est dit qu'ils ne se sont pas traduits par un chiffre visible dans les comptes. La plupart se sont arrêtés à des gains de productivité individuels — que quelqu'un rédige plus vite son courriel n'apparaît dans aucun indicateur — sans jamais atteindre le processus qui facture, encaisse ou livre.
Gartner arrive au même point par un autre angle. En juin 2025, le cabinet prévoyait que plus de 40 % des projets d'IA agentique seront abandonnés avant la fin 2027, pour cause de coûts croissants, de valeur métier floue ou de contrôles du risque insuffisants. Deux mois plus tard, il estimait que 40 % des applications d'entreprise intégreront des agents spécialisés fin 2026, contre moins de 5 % en 2025.
L'IA va s'installer partout et la plupart des projets qui la poursuivent en tant que projet seront abandonnés. Ce n'est pas contradictoire : cela signifie que l'IA arrivera incorporée à des processus et des applications qui fonctionnent déjà, et non comme une initiative autonome avec son propre comité. La traiter comme un programme à part, voilà l'erreur coûteuse.
Les cinq raisons pour lesquelles un pilote meurt
Aucune ne concerne la qualité du modèle. Toutes concernent l'environnement dans lequel on lui a demandé de travailler.
- Il vivait à côté du processus, pas dedans. Le pilote était un écran à part où il fallait déposer les documents à la main et d'où il fallait recopier le résultat. Cela tient avec vingt cas de test et se abandonne à deux cents, car le va-et-vient absorbe le gain.
- Personne n'a tranché le sort des cas atypiques. L'IA réussit le cas standard ; la valeur est dans ce qui arrive aux 8 % qui ne le sont pas. Sans règle explicite — vers qui, avec quelle priorité, sous quel délai —, l'exception retourne dans la messagerie et le processus cesse d'en être un.
- Il n'y avait pas de valeur de référence. Si l'on n'a pas mesuré la durée et le coût du processus avant, l'amélioration est indémontrable. Et ce qui n'est pas démontré n'est pas budgété l'année suivante. C'est l'échec le moins cher à éviter et le plus fréquent.
- Le propriétaire était technique. Les pilotes qui survivent sont demandés par qui subit le problème — direction administrative, achats, ressources humaines — car c'est cette personne qui défend le budget au moment de décider. Un sponsor informatique peut construire, pas justifier.
- Le coût par dossier n'a pas été calculé à l'échelle. Consommation du modèle, relecture humaine, reprises et maintenance sont négligeables à cent documents par mois et déterminants à cent mille. Ce calcul se fait avant de signer, pas après.
La recherche du MIT ajoute une cause de fond qui recoupe les cinq : les systèmes déployés n'apprennent pas de l'usage. Ils ne retiennent pas le jugement du relecteur, ne s'adaptent pas au contexte de l'entreprise et ne s'améliorent pas avec le temps. Ils démarrent à un taux de réussite correct et y restent, alors que l'équipe attendait une courbe ascendante.
Ce qui sépare une démo d'un processus en production
L'écart entre les deux colonnes ci-dessous, c'est là que se perdent les 95 %. Le tableau se lit avant la démo, pas après.
| Dimension | En démo | En production |
|---|---|---|
| Les données | Vingt exemples choisis, propres et lisibles. | Scans de travers, télécopies, photos de téléphone et le format étrange d'un fournisseur précis. |
| L'entrée | Quelqu'un dépose le fichier à la main. | Il arrive seul par courriel, portail ou interface, il est identifié et routé sans intervention. |
| L'erreur | On la commente et on passe à l'exemple suivant. | Elle a un chemin : détectée, transmise à une personne, close dans un délai. |
| La trace | Inutile. | Qui a décidé quoi, avec quelle version et sur quelle preuve. C'est ce que l'on montre en audit. |
| Les droits | Un utilisateur qui voit tout. | Chacun voit le sien ; l'assistant hérite de ces droits et ne peut pas les élargir. |
| Le coût | Sans importance. | Des centimes par dossier multipliés par le volume annuel, plus la relecture humaine. |
Aucune de ces six lignes ne se règle par un meilleur modèle. Toutes se règlent par un processus autour du modèle : routage, exceptions, droits, journalisation et mesure. C'est exactement le rôle d'un BPM, et c'est pourquoi l'IA qui rapporte est généralement bâtie dessus.
Agent washing : agent ou chatbot rebaptisé ?
Gartner a nommé le phénomène : l'agent washing, cette pratique consistant à réétiqueter en agents d'IA des produits existants — assistants, robots RPA, chatbots à règles. Son estimation, dans la note qui annonce les abandons, est nette : sur des milliers de fournisseurs se présentant comme agentiques, seuls environ 130 le sont vraiment.
Quatre questions suffisent, en rendez-vous commercial, à séparer le fond de l'emballage :
- Décide-t-il ou se contente-t-il de répondre ? Un agent choisit entre plusieurs chemins selon l'état du dossier. Si le parcours est fixé d'avance, c'est un flux avec du langage naturel par-dessus — fort utile, mais pas la même chose, et cela ne devrait pas coûter pareil.
- Agit-il sur un système réel ? Écrire dans l'ERP, générer l'écriture, créer le dossier. S'il ne renvoie qu'un texte à recopier, la recopie garde le gain.
- Laisse-t-il trace de ses raisons ? Sans journal de décision, pas d'audit possible ; sans audit, pas de déploiement dans un processus réglementé.
- Où est le frein ? Ce qu'il ne peut jamais faire, quel montant déclenche une validation humaine, qui révoque ses droits. Une réponse vague signifie que le contrôle du risque n'existe pas — l'une des trois causes d'abandon citées par Gartner.
Nous détaillons le chemin pratique de mise en œuvre dans comment réduire les délais d'implémentation d'un BPM avec IA.
Acheter ou construire : le constat qui dérange
C'est la décision qui consomme le plus de temps en comité et celle que l'étude du MIT tranche avec le moins d'ambiguïté : les déploiements adossés à des fournisseurs spécialisés ont réussi environ deux fois plus souvent que les développements internes.
Ce n'est pas une question de talent, mais de périmètre. Quand une entreprise décide de construire, elle ne construit pas « un appel à un modèle » ; elle prend aussi en charge l'évaluation continue, la gestion des versions, le contrôle des accès, la traçabilité, le traitement des exceptions et la migration quand le modèle utilisé sera obsolète dans dix-huit mois. Rien de tout cela ne figure dans l'estimation initiale, et c'est précisément ce qui finit par absorber l'équipe.
La règle pratique : construisez ce qui vous différencie, achetez ce qui vous coûte. Un modèle de risque propriétaire fondé sur des données que vous seul détenez peut justifier l'effort. Classer des factures fournisseurs, extraire les champs d'un bon de livraison ou router le courrier entrant, non : c'est déjà une fonction produit, et cela coûte moins que le premier mois de développement.
Sept filtres avant d'approuver le prochain pilote
Si un pilote ne passe pas les sept, le risque n'est pas qu'il tourne mal : c'est qu'on ne puisse pas démontrer qu'il a bien tourné. Ce qui est pire.
- Un propriétaire métier nommé. La personne qui subit le problème aujourd'hui et défendra le budget demain.
- Une valeur de référence mesurée. Dossiers par mois, minutes par dossier, coût par dossier et taux d'erreur actuel. Avant toute intervention.
- Un critère de succès acté par écrit. Un chiffre et une date : « ramener la clôture du dossier de 9 à 3 jours avant le 30 novembre ».
- Des données réelles et ingrates. Les dossiers du dernier trimestre tels qu'ils sont arrivés, y compris les trois fournisseurs aux formats impossibles.
- Un chemin défini pour les exceptions. Vers qui, sous quel délai, avec quelle priorité. Sans cela, pas de production.
- L'intégration actée dès le premier jour. D'où entre le dossier et où sort le résultat. Si la réponse est « on verra en phase deux », la phase deux n'arrive pas.
- Une date de clôture. Quatre à huit semaines, avec décision binaire : production avec budget, ou clôture et enseignements documentés.
Le septième filtre est le plus inconfortable et le plus utile. Un pilote sans date de clôture n'échoue jamais : il s'installe dans un flou indéfini en consommant de l'attention. C'est exactement ce que décrivent les 95 %.
Comment Dokuflex le résout : l'IA comme étape du processus, pas comme projet
Notre position est celle que soutiennent les données : le problème n'est presque jamais le modèle, c'est tout ce qui l'entoure. C'est pourquoi, dans Dokuflex BPM low-code, l'IA n'est pas un produit à part mais un type de tâche dans le flux.
- Le dossier entre tout seul. Courriel, portail, interface ou capture depuis la gestion documentaire. Personne ne dépose de fichiers dans un écran à part, première cause d'abandon.
- L'exception a déjà un chemin. Si la confiance passe sous le seuil ou si le montant dépasse la limite, le dossier part vers la personne concernée avec son délai. Le routage fait partie du flux, pas d'une liste de tâches en attente.
- La mesure est native. Chaque étape est journalisée et horodatée : la comparaison avant/après n'a pas à être montée, elle se lit. C'est la trace qu'exploite le process mining.
- Changer, c'est configurer. Ajuster un seuil, ajouter une validation ou changer le destinataire d'une exception, c'est modifier le processus et publier la version. Ce cycle court permet d'arriver à la huitième semaine avec des résultats plutôt qu'un point d'avancement.
Et le traitement intelligent des documents règle la ligne la plus ingrate du tableau : les documents vraiment moches, ceux qui coulent les pilotes bâtis sur vingt PDF parfaits.
Comment choisir le premier cas
L'instinct pousse vers le processus le plus spectaculaire. Résistez : le premier cas n'est pas là pour impressionner, il est là pour démontrer que le cycle complet fonctionne dans votre organisation. Quatre conditions :
- Volume élevé et répétitif. Sans volume, pas de gain visible, aussi bonne soit la technologie.
- Règles claires. Si deux experts internes ne s'accordent pas sur ce qui est correct, le problème n'est pas d'IA.
- Erreur tolérable et réversible. Un champ mal extrait corrigé à la relecture, pas une décision qui atteint le client sans filtre.
- Historique disponible. C'est ce qui permet de comparer à la référence et de clore le débat avec des données.
Saisie des factures fournisseurs, tri du courrier entrant, vérification documentaire d'une ouverture de compte. Des cas ennuyeux, et c'est pour cela qu'ils gagnent.
Questions fréquentes
Est-il vrai que 95 % des pilotes d'IA échouent ? +
Le chiffre vient du rapport The GenAI Divide: State of AI in Business 2025, de MIT NANDA, et mérite une lecture précise : il ne dit pas que 95 % des pilotes ne fonctionnent pas techniquement, il dit que 95 % des organisations n'ont obtenu aucun retour mesurable dans leur compte de résultat. La nuance compte, car l'échec ne tient pas au modèle mais au saut entre l'expérimentation et le processus qui facture, encaisse ou livre.
Pourquoi un pilote qui marchait en démo finit-il par mourir ? +
Pour cinq raisons récurrentes : le pilote vivait à côté du processus et non dedans, quelqu'un devait donc copier-coller ; personne n'avait défini le sort des exceptions ; il n'existait pas de valeur de référence, l'amélioration était donc indémontrable ; il n'y avait pas de propriétaire métier, seulement un sponsor technique ; et le coût par dossier, négligeable à cent documents, ne l'était plus à cent mille.
Qu'est-ce que l'agent washing ? +
C'est la pratique consistant à rebaptiser « agent d'IA » un produit qui existait déjà : un assistant conversationnel, un robot RPA ou un chatbot à règles. Gartner l'a nommée en juin 2025 en avertissant que plus de 40 % des projets d'IA agentique seront abandonnés avant la fin 2027, et a estimé que sur les milliers de fournisseurs se présentant comme agentiques, seuls environ 130 le sont vraiment. Le test pratique : s'il ne peut pas choisir entre plusieurs chemins, agir sur un système réel et laisser trace de ses raisons, ce n'est pas un agent.
Faut-il acheter une solution d'IA ou la construire en interne ? +
La recherche du MIT pointe dans une direction claire : les déploiements adossés à des fournisseurs spécialisés ont réussi environ deux fois plus souvent que les développements internes. La raison n'est pas la qualité de l'équipe, mais le périmètre : construire, c'est aussi assumer l'évaluation, la supervision, le versionnement, la traçabilité et la maintenance quand le modèle change. Pour un cas d'usage réellement différenciant, cela peut se justifier ; pour classer des factures, non.
Combien de temps doit durer un pilote d'IA ? +
Entre quatre et huit semaines. Au-delà, c'est presque toujours qu'il est devenu un projet d'intégration déguisé en essai. Un pilote bien posé part d'une valeur de référence mesurée avant toute intervention, s'exécute sur des dossiers réels du dernier trimestre et se termine par une décision binaire : passage en production avec propriétaire et budget, ou clôture.
Que faut-il mesurer pour savoir si un pilote d'IA a fonctionné ? +
Quatre chiffres, dont aucun n'est la précision du modèle : durée totale du dossier de bout en bout comparée à la référence ; part des dossiers traités sans intervention humaine ; taux d'erreur atteignant le client final ; et coût par dossier, consommation du modèle, relecture humaine et maintenance comprises. La précision est un indicateur interne ; ces quatre-là parlent à un comité de direction.
Par où commencer avec l'IA dans les processus ? +
Par un processus à fort volume, à règles claires, avec des documents d'entrée répétitifs et un coût d'erreur tolérable et réversible : saisie des factures fournisseurs, tri du courrier entrant, vérification documentaire d'une ouverture de compte. Des cas ennuyeux, et c'est précisément pour cela qu'ils fonctionnent : il y a un historique pour comparer, une valeur antérieure à améliorer, et une erreur se détecte et se corrige sans conséquence grave.
Sources
- MIT NANDA — The GenAI Divide: State of AI in Business 2025 (PDF) : absence de retour mesurable dans 95 % des organisations, écart d'apprentissage et avantage des déploiements adossés à un fournisseur.
- Gartner, 25 juin 2025 : plus de 40 % des projets d'IA agentique abandonnés avant fin 2027 ; définition de l'agent washing.
- Gartner, 26 août 2025 : 40 % des applications d'entreprise avec des agents spécialisés fin 2026.
Commencez par le chiffre, pas par la démo
Réservez 30 minutes : nous prenons le processus que vous voulez automatiser et nous établissons ce qu'il vous coûte aujourd'hui. Avec ce chiffre sur la table, toute conversation ultérieure — avec nous ou avec d'autres — devient beaucoup plus courte.