KI · Automatisierung · Kaufentscheidung

95 % der KI-Piloten gehen nie in Produktion: was die übrigen 5 % anders machen

Die Demo lief rund. Das Gremium applaudierte. Sechs Monate später weiß niemand mehr genau, was daraus wurde. Das ist mit Abstand der häufigste Ausgang eines KI-Piloten — und die Daten dazu sind längst keine Meinung mehr.

Dieser Leitfaden fasst zusammen, was MIT und Gartner gefunden haben, warum Piloten sterben, was eine Demo von einem laufenden Prozess trennt, wie man Agent Washing erkennt und welche sieben Filter vor der nächsten Freigabe sinnvoll sind.

Laborschale mit erloschenen, gesprungenen KI-Piloten neben einer einzelnen leuchtenden Kugel, die durch ein Glastor in eine laufende Prozessbahn mit bernsteinfarbenem Kontrollpunkt einrastet
AR
Inhaber von Dokuflex
Aktualisiert: 10. September 2026

Für Geschäftsführung, Betrieb und IT. Ein Bewertungsleitfaden für alle, die über Freigabe, Verlängerung oder Abbruch eines KI-Piloten entscheiden. Mit Kriterien zur Anbieterauswahl und den Kennzahlen, die vorher festzulegen sind.

Direkte Antwort

KI-Piloten sterben nicht am Modell, sondern daran, dass sie den echten Prozess nie berührt haben. Die MIT-Studie fand bei 95 % der untersuchten Organisationen keinen messbaren Ertrag, und das Muster der übrigen 5 % ist stets dasselbe: abgegrenzter Fall, vor dem Start gemessener Ausgangswert, KI, die im Ablauf läuft, ein festgelegter Weg für Ausnahmen und ein fachlicher Eigentümer mit Budget.

Die Zahlen: was MIT und Gartner gefunden haben

Die meistzitierte Schlagzeile des vergangenen Jahres stammt aus dem Bericht The GenAI Divide: State of AI in Business von MIT NANDA, gestützt auf über dreihundert geprüfte Initiativen, rund fünfzig Interviews und etwa hundertfünfzig Antworten von Führungskräften. Sein Befund: 95 % der Organisationen erzielten keinen messbaren Ertrag aus ihren Piloten mit generativer KI.

Das verdient eine genaue Lesart, denn die Nuance ist alles. Es heißt nicht, dass die Werkzeuge nicht funktionieren. Es heißt, dass sie sich nicht in eine sichtbare Zahl in der Bilanz übersetzt haben. Das meiste blieb bei individueller Produktivität stehen — dass jemand seine E-Mail schneller schreibt, taucht in keiner Kennzahl auf — und erreichte nie den Prozess, der fakturiert, kassiert oder liefert.

Gartner kommt von der anderen Seite zum selben Punkt. Im Juni 2025 prognostizierte das Haus, dass über 40 % der agentischen KI-Projekte vor Ende 2027 abgebrochen werden — wegen steigender Kosten, unklaren Geschäftsnutzens oder unzureichender Risikokontrollen. Zwei Monate später schätzte es, dass 40 % der Unternehmensanwendungen bis Ende 2026 aufgabenspezifische KI-Agenten enthalten werden, gegenüber weniger als 5 % im Jahr 2025.

Beide Zahlen zusammen

KI wird überall sein und die meisten Projekte, die sie als Projekt verfolgen, werden abgebrochen. Das ist kein Widerspruch: Es bedeutet, dass KI eingebettet in bereits laufende Prozesse und Anwendungen ankommt, nicht als eigenständige Initiative mit eigenem Lenkungsausschuss. Sie als separates Programm zu behandeln, ist der teure Fehler.

Die fünf Gründe, warum ein Pilot stirbt

Keiner davon betrifft die Modellqualität. Alle betreffen die Umgebung, in der das Modell arbeiten sollte.

  1. Er lebte neben dem Prozess, nicht darin. Der Pilot war ein eigener Bildschirm, in den Dokumente von Hand hochgeladen und aus dem Ergebnisse herauskopiert wurden. Das trägt bei zwanzig Testfällen und wird bei zweihundert aufgegeben, weil das Hin- und Herschieben die Ersparnis auffrisst.
  2. Niemand entschied über das Ungewöhnliche. KI trifft den Standardfall; der Wert steckt darin, was mit den 8 % geschieht, die es nicht sind. Ohne ausdrückliche Regel — an wen, mit welcher Priorität, in welcher Frist — landet die Ausnahme wieder in der E-Mail und der Prozess ist keiner mehr.
  3. Es gab keinen Ausgangswert. Wurde nicht gemessen, wie lange der Prozess vorher dauerte und was er kostete, lässt sich die Verbesserung nicht belegen. Und was nicht belegt ist, wird im Folgejahr nicht budgetiert. Das ist der am billigsten vermeidbare und zugleich häufigste Fehler.
  4. Der Eigentümer war technisch. Überlebende Piloten fordert an, wer das Problem erleidet — Verwaltungs-, Einkaufs- oder Personalleitung —, denn diese Person verteidigt das Budget, wenn entschieden wird. Ein IT-Sponsor kann bauen, aber nicht rechtfertigen.
  5. Die Kosten pro Fall wurden nie hochgerechnet. Modellverbrauch, menschliche Prüfung, Wiederholungen und Wartung sind bei hundert Dokumenten im Monat belanglos und bei hunderttausend entscheidend. Diese Rechnung gehört vor die Unterschrift, nicht danach.

Die MIT-Untersuchung ergänzt eine Ursache, die zu allen fünf passt: Die eingeführten Systeme lernen nicht aus der Nutzung. Sie behalten das Urteil der prüfenden Person nicht, passen sich dem Unternehmenskontext nicht an und werden mit der Zeit nicht besser. Sie starten mit einer vertretbaren Trefferquote und bleiben dort, während das Team eine steigende Kurve erwartet hatte.

Was eine Demo von einem laufenden Prozess trennt

Der Abstand zwischen den beiden Spalten ist der Ort, an dem die 95 % verloren gehen. Die Tabelle lohnt sich vor der Demo, nicht danach.

Dimension In der Demo In Produktion
Die Daten Zwanzig ausgewählte, saubere, lesbare Beispiele. Schiefe Scans, Faxe, Handyfotos und das eigenwillige Format eines bestimmten Lieferanten.
Der Eingang Jemand lädt die Datei von Hand hoch. Sie kommt von selbst per E-Mail, Portal oder Schnittstelle, wird erkannt und ohne Eingriff weitergeleitet.
Der Fehler Wird kommentiert, dann kommt das nächste Beispiel. Hat einen Weg: erkannt, an eine Person übergeben, mit Frist geschlossen.
Die Spur Wird nicht gebraucht. Wer hat was entschieden, mit welcher Version, auf welcher Grundlage. Das zeigt man in einer Prüfung.
Berechtigungen Ein Konto, das alles sieht. Jede Person sieht ihres; der Assistent erbt diese Rechte und kann sie nicht erweitern.
Die Kosten Belanglos. Cent pro Fall mal Jahresvolumen, plus menschliche Prüfung.

Keine dieser sechs Zeilen löst ein besseres Modell. Alle löst ein Prozess um das Modell herum: Weiterleitung, Ausnahmen, Berechtigungen, Protokoll und Messung. Genau das leistet ein BPM — und deshalb steht die KI, die sich rechnet, meist auf einem.

Agent Washing: Agent oder umbenannter Chatbot?

Gartner gab dem Phänomen einen Namen: Agent Washing, das Umetikettieren bestehender Produkte — Assistenten, RPA-Roboter, regelbasierte Chatbots — zu KI-Agenten. Die Schätzung aus derselben Mitteilung ist deutlich: Von Tausenden Anbietern, die sich als agentisch präsentieren, sind nur rund 130 es wirklich.

Vier Fragen genügen im Vertriebsgespräch, um Substanz von Verpackung zu trennen:

  • Entscheidet es oder antwortet es nur? Ein Agent wählt je nach Zustand des Falls zwischen möglichen Wegen. Steht der Weg vorab fest, ist es ein Ablauf mit natürlicher Sprache obendrauf — durchaus nützlich, aber nicht dasselbe und nicht denselben Preis wert.
  • Handelt es in einem echten System? Schreiben ins ERP, Buchung anlegen, Akte eröffnen. Gibt es nur Text zurück, den jemand kopiert, behält das Kopieren die Ersparnis.
  • Hält es fest, warum es so gehandelt hat? Ohne Entscheidungsprotokoll keine Prüfbarkeit, und ohne Prüfbarkeit kein Einsatz in einem regulierten Prozess.
  • Wo ist die Bremse? Was darf es nie, welcher Betrag löst eine menschliche Freigabe aus, wer entzieht ihm Rechte. Bleibt die Antwort vage, existiert die Risikokontrolle nicht — einer der drei Abbruchgründe, die Gartner nennt.

Den praktischen Weg in die Umsetzung beschreiben wir in wie sich die BPM-Einführung mit KI beschleunigen lässt.

Kaufen oder bauen: der unbequeme Befund

Es ist die Entscheidung, die in Gremien am meisten Zeit kostet, und die das MIT am eindeutigsten beantwortet: Einführungen mit spezialisierten Anbietern waren etwa doppelt so oft erfolgreich wie Eigenentwicklungen.

Das ist keine Frage des Talents, sondern des Umfangs. Wer baut, baut nicht „einen Modellaufruf"; er übernimmt auch laufende Bewertung, Versionsverwaltung, Zugriffskontrolle, Nachvollziehbarkeit, Ausnahmebehandlung und die Migration, wenn das genutzte Modell in achtzehn Monaten veraltet. Nichts davon steht in der Anfangsschätzung, und genau das verbraucht am Ende das Team.

Die Faustregel: Bauen Sie, was Sie unterscheidet; kaufen Sie, was Sie kostet. Ein eigenes Risikomodell auf Daten, die nur Sie haben, kann den Aufwand rechtfertigen. Lieferantenrechnungen klassifizieren, Felder aus einem Lieferschein ziehen oder Posteingänge verteilen nicht: Das ist längst Produktfunktion und kostet weniger als der erste Monat der Entwicklung.

Sieben Filter vor der nächsten Freigabe

Passiert ein Pilot nicht alle sieben, droht nicht, dass er schlecht ausgeht: Es droht, dass sich ein guter Ausgang nicht belegen lässt. Was schlimmer ist.

  1. Fachlicher Eigentümer mit Namen. Die Person, die das Problem heute erleidet und morgen das Budget verteidigt.
  2. Gemessener Ausgangswert. Fälle pro Monat, Minuten pro Fall, Kosten pro Fall und heutige Fehlerquote. Vor jedem Eingriff.
  3. Schriftlich vereinbartes Erfolgskriterium. Eine Zahl und ein Datum: „Aktenschluss von 9 auf 3 Tage bis zum 30. November".
  4. Echte, hässliche Daten. Die Fälle des letzten Quartals genau so, wie sie ankamen, inklusive der drei Lieferanten mit unmöglichen Rechnungsformaten.
  5. Festgelegter Weg für Ausnahmen. An wen, mit welcher Frist, mit welcher Priorität. Ohne das keine Produktion.
  6. Integration ab Tag eins vereinbart. Woher der Fall kommt und wohin das Ergebnis geht. Heißt es „das sehen wir in Phase zwei", kommt Phase zwei nicht.
  7. Abschlussdatum. Vier bis acht Wochen, mit binärer Entscheidung: Produktion mit Budget — oder Abschluss mit dokumentierten Erkenntnissen.

Der siebte Filter ist der unbequemste und der wertvollste. Ein Pilot ohne Abschlussdatum scheitert nie: Er bleibt unbestimmt liegen und verbraucht Aufmerksamkeit. Genau das beschreiben die 95 %.

Wie Dokuflex das löst: KI als Prozessschritt, nicht als Projekt

Unsere Position ist die, die die Daten stützen: Das Problem ist fast nie das Modell, sondern alles drumherum. Deshalb ist KI in Dokuflex BPM low-code kein eigenes Produkt, sondern ein Aufgabentyp im Ablauf.

  • Der Fall kommt von selbst herein. E-Mail, Portal, Schnittstelle oder Erfassung aus dem Dokumentenmanagement. Niemand lädt Dateien in einen separaten Bildschirm — die häufigste Abbruchursache.
  • Die Ausnahme hat bereits einen Weg. Liegt die Konfidenz unter der Schwelle oder der Betrag über dem Limit, geht die Akte mit Frist an die zuständige Person. Weiterleitung ist Teil des Ablaufs, keine offene Aufgabe.
  • Die Messung ist eingebaut. Jeder Schritt wird mit Zeitstempel protokolliert, der Vorher-nachher-Vergleich muss also nicht gebaut werden: Er wird abgelesen. Dieselbe Spur nutzt Process Mining.
  • Ändern heißt konfigurieren. Eine Schwelle anpassen, eine Prüfung ergänzen oder den Empfänger einer Ausnahme ändern heißt: Prozess bearbeiten und Version veröffentlichen. Dieser kurze Zyklus bringt Sie in Woche acht zu Ergebnissen statt zu einem Statusbericht.

Und die intelligente Dokumentenverarbeitung löst die undankbarste Zeile der Tabelle: die wirklich hässlichen Dokumente, an denen Piloten scheitern, die auf zwanzig perfekten PDFs gebaut wurden.

Demo mit Ihren eigenen Dokumenten anfragen, nicht mit unseren →

Wie man den ersten Fall auswählt

Der Instinkt greift zum eindrucksvollsten Prozess. Widerstehen Sie: Der erste Fall soll nicht beeindrucken, er soll belegen, dass der ganze Zyklus funktioniert — in Ihrer Organisation. Vier Bedingungen:

  • Hohes, wiederkehrendes Volumen. Ohne Volumen keine sichtbare Ersparnis, so gut die Technik auch ist.
  • Klare Regeln. Wenn sich zwei interne Fachleute nicht einig sind, was richtig ist, ist das kein KI-Problem.
  • Tragbarer, umkehrbarer Fehler. Ein falsch ausgelesenes Feld, das in der Prüfung korrigiert wird — keine Entscheidung, die ungefiltert beim Kunden landet.
  • Verfügbare Historie. Sie erlaubt den Vergleich mit dem Ausgangswert und beendet die Debatte mit Daten.

Erfassung von Lieferantenrechnungen, Sortierung des Posteingangs, Dokumentenprüfung bei einer Kundenneuanlage. Langweilige Fälle — und deshalb gewinnen sie.

Häufige Fragen

Stimmt es, dass 95 % der KI-Piloten scheitern? +

Die Zahl stammt aus dem Bericht The GenAI Divide: State of AI in Business 2025 von MIT NANDA und sollte genau gelesen werden: Es heißt nicht, dass 95 % der Piloten technisch nicht funktionieren, sondern dass 95 % der Organisationen keinen messbaren Ertrag in der Gewinn- und Verlustrechnung erzielten. Der Unterschied zählt, denn das Versagen liegt nicht am Modell, sondern am Sprung vom Experiment in den Prozess, der fakturiert, kassiert oder liefert.

Warum stirbt ein Pilot, der in der Demo gut lief? +

Aus fünf wiederkehrenden Gründen: Der Pilot lebte neben dem Prozess statt darin, also musste jemand kopieren und einfügen; niemand legte fest, was mit Ausnahmen geschieht; es gab keinen Ausgangswert, also ließ sich die Verbesserung nicht belegen; es gab keinen fachlichen Eigentümer, nur einen technischen Sponsor; und die Kosten pro Fall, bei hundert Dokumenten belanglos, waren es bei hunderttausend nicht mehr.

Was ist Agent Washing? +

Es ist die Praxis, ein bestehendes Produkt als „KI-Agent" neu zu etikettieren: einen Chat-Assistenten, einen RPA-Roboter oder einen regelbasierten Chatbot. Gartner benannte das im Juni 2025 mit der Warnung, dass über 40 % der agentischen KI-Projekte vor Ende 2027 abgebrochen werden, und schätzte, dass von Tausenden Anbietern, die sich als agentisch darstellen, nur rund 130 es wirklich sind. Der praktische Test: Kann es nicht zwischen mehreren Wegen entscheiden, auf einem echten System handeln und nachvollziehbar festhalten, warum es so gehandelt hat, ist es kein Agent.

Kaufen oder selbst bauen? +

Die MIT-Untersuchung zeigt eine klare Richtung: Einführungen mit spezialisierten Anbietern waren etwa doppelt so oft erfolgreich wie Eigenentwicklungen. Der Grund ist nicht die Qualität des eigenen Teams, sondern der Umfang: Bauen heißt auch Bewertung, Aufsicht, Versionierung, Nachvollziehbarkeit und Wartung übernehmen, wenn sich das Modell ändert. Für einen wirklich differenzierenden Anwendungsfall kann sich das lohnen; für das Klassifizieren von Rechnungen nicht.

Wie lange sollte ein KI-Pilot dauern? +

Vier bis acht Wochen. Dauert er länger, ist er fast immer zu einem als Test getarnten Integrationsprojekt geworden. Ein gut aufgesetzter Pilot beginnt mit einem vor jedem Eingriff gemessenen Ausgangswert, läuft auf echten Fällen des letzten Quartals und endet mit einer binären Entscheidung: Produktion mit Eigentümer und Budget — oder Abschluss.

Was muss man messen, um den Erfolg eines KI-Piloten zu beurteilen? +

Vier Zahlen, und keine davon ist die Modellgenauigkeit: Gesamtdurchlaufzeit des Falls gegenüber dem Ausgangswert; Anteil der Fälle, die ohne menschlichen Eingriff abgeschlossen werden; Fehlerquote, die beim Endkunden ankommt; und Kosten pro Fall inklusive Modellverbrauch, menschlicher Prüfung und Wartung. Genauigkeit ist ein interner Indikator; diese vier versteht eine Geschäftsleitung.

Womit beginnt man bei KI in Prozessen am besten? +

Mit einem Prozess mit hohem Volumen, klaren Regeln, wiederkehrenden Eingangsdokumenten und tragbaren, umkehrbaren Fehlerkosten: Erfassung von Lieferantenrechnungen, Sortierung des Posteingangs, Dokumentenprüfung bei einer Neuanlage. Langweilige Fälle — und genau deshalb funktionieren sie: Es gibt Historie zum Vergleich, einen Vorwert zum Verbessern, und ein Fehler wird ohne schwere Folgen erkannt und korrigiert.

Quellen

Nächster Schritt

Beginnen Sie mit der Zahl, nicht mit der Demo

Buchen Sie 30 Minuten: Wir nehmen den Prozess, den Sie automatisieren wollen, und ermitteln, was er heute kostet. Mit dieser Zahl auf dem Tisch wird jedes weitere Gespräch — mit uns oder mit anderen — deutlich kürzer.