Die Provokation trifft einen wahren Kern: Unternehmen verlangen von einer Technologie, die noch lernen muss, dass sie sich verhält wie ein Prozess, der bereits verstanden ist. Business Case vor dem ersten belastbaren Experiment. ROI-Nachweis vor der Integration in den Arbeitsablauf. Ein Skalierungsurteil, obwohl bislang nur technische Machbarkeit getestet wurde.

Doch bevor man die Technik freispricht und die Organisation verurteilt, lohnt sich ein genauer Blick auf die Zahl, die diese Debatte antreibt.

95 Prozent — starkes Signal, kein Naturgesetz.

Der Bericht The GenAI Divide: State of AI in Business 2025 von Project NANDA nennt 30 bis 40 Milliarden US-Dollar an Unternehmensinvestitionen in generative KI und kommt zu dem Ergebnis, dass 95 Prozent der betrachteten Organisationen keinen messbaren Ertrag erzielen. Nur fünf Prozent integrierter KI-Piloten hätten einen materiellen P&L-Effekt erreicht.

Das ist relevant — aber enger, als die Schlagzeile „95 Prozent aller KI-Projekte scheitern“ vermuten lässt. Der Bericht bezeichnet seine Ergebnisse selbst als vorläufig. Er kombiniert über 300 öffentlich bekannte Initiativen mit Interviews aus 52 Organisationen und 153 Antworten von Führungskräften. Die Pilotquoten beruhen teilweise auf Interviewaussagen statt testierter Unternehmensdaten; Definitionen von Erfolg können variieren.

Quelle & Einordnung Der Bericht beschreibt 95 Prozent ohne messbaren P&L-Effekt als richtungsweisendes Ergebnis seiner Stichprobe. Er weist ausdrücklich auf unterschiedliche Stichprobengrößen, Erfolgsdefinitionen und interviewbasierte Daten hin. — Challapally, Pease, Raskar & Chari · The GenAI Divide: State of AI in Business 2025, Project NANDA, 2025

Für einen Vorstand ist die Zahl deshalb weder Beweis, dass KI wertlos ist, noch Freispruch für die Technologie. Modelle, Datenqualität und Kosten können sehr wohl limitieren. Der strategisch relevante Befund liegt tiefer: Der Bericht findet besonders häufig brüchige Workflows, fehlende Kontextanpassung und mangelnde Einbettung in den Arbeitsalltag. Viele Piloten testen ein Modell — aber nicht das künftige Betriebssystem darum herum.

Zwei Betriebssysteme, zwei Rationalitäten.

Das Kerngeschäft ist auf Ausführung optimiert: Wiederholung, Qualität, Planbarkeit, geringe Varianz. Abweichung ist ein Fehler, den ein gutes System reduziert. Das ist keine Innovationsfeindlichkeit, sondern operative Exzellenz.

Exploration folgt einer anderen Logik: Annahmen explizit machen, Unsicherheit reduzieren, Alternativen testen. Abweichung ist dort Information. Nicht jede Suche muss erfolgreich sein; sie muss mit vertretbarem Einsatz eine relevante Entscheidung ermöglichen.

AusführenBekannten Wert zuverlässig liefern

ErkundenHerausfinden, welcher Wert überhaupt lieferbar ist

AusführenVarianz reduzieren und Plan erfüllen

ErkundenAnnahmen testen und Optionen schließen

AusführenROI und Prozessstabilität nachweisen

ErkundenEvidenz für Nutzung, Qualität und Machbarkeit erzeugen

Forschung zur organisationalen Ambidextrie bestätigt den Grundgedanken: Exploration und Exploitation brauchen unterschiedliche Strukturen, müssen aber durch das Senior Team strategisch integriert werden. Das Problem ist nicht, dass zwei Logiken existieren. Es entsteht, wenn niemand entscheidet, welche gerade gelten soll.

Forschungsbasis Ambidextre Organisationsdesigns verbinden strukturelle Differenzierung mit Integration auf Führungsebene. In einer longitudinalen Untersuchung waren sie wirksamer für Innovationsströme als funktionale, bereichsübergreifende oder vollständig ausgegliederte Designs. — Tushman et al. · Organizational Designs and Innovation Streams, 2010

Nicht weniger Governance. Andere Gates.

Die Konsequenz ist nicht, KI-Piloten ohne Business-Verantwortung oder Kontrolle laufen zu lassen. Gerade bei sensiblen Daten, automatisierten Entscheidungen und regulatorischen Risiken braucht Exploration von Anfang an klare Grenzen. Aber jedes Gate muss die Frage stellen, die in dieser Phase tatsächlich beantwortbar ist.

So wird der Business Case nicht abgeschafft, sondern an die richtige Stelle verschoben. Vor dem Experiment braucht es eine Werthypothese und eine Abbruchlogik. Nach der Integration braucht es den wirtschaftlichen Nachweis. Wer beides verwechselt, fordert Gewissheit, bevor die Organisation die dafür nötige Evidenz erzeugt hat.

Der C-Level-Test für einen KI-Piloten lautet deshalb nicht nur: „Was hat er gebracht?“ Sondern zunächst: „Welche Unsicherheit sollte er reduzieren — und welche Entscheidung können wir heute besser treffen als vor dem Versuch?“

KI-Piloten sterben nicht immer an der Technik und nicht immer an der Organisation. Aber sie sterben zuverlässig, wenn ein Suchprozess wie ein fertiger Betrieb geführt wird.