
Datenqualitätsmanagement für KI-Systeme planen

Ein KI-Modell kann fachlich überzeugend entwickelt sein und dennoch im Betrieb scheitern. Häufig liegt die Ursache nicht im Modell, sondern in widersprüchlichen Stammdaten, nicht dokumentierten Transformationen oder fehlenden Zuständigkeiten für Korrekturen. Datenqualitätsmanagement für KI Systeme schafft hier die notwendige Steuerbarkeit: Es macht Datenherkunft, Prüfregeln, Freigaben und Abweichungen nachvollziehbar - bevor fehlerhafte Ergebnisse operative Entscheidungen beeinflussen.
Für Unternehmen mit SAP-Landschaften, heterogenen Datenquellen und regulierten Prozessen ist Datenqualität kein isoliertes Data-Science-Thema. Sie betrifft Geschäftsprozesse, Berechtigungen, Schnittstellen, Testverfahren und die Revisionsfähigkeit von Entscheidungen. Wer KI produktionsnah einsetzen will, muss diese Zusammenhänge in eine belastbare Betriebsstruktur überführen.
Warum KI andere Anforderungen an Datenqualität stellt
Klassische Berichte können trotz einzelner fehlerhafter Werte noch plausibel wirken. Ein KI-System verarbeitet dagegen oft sehr große Datenmengen, erkennt statistische Muster und nutzt diese als Grundlage für Prognosen, Klassifikationen oder Handlungsempfehlungen. Wiederkehrende Fehler, systematische Lücken oder verzerrte Datenbestände werden dadurch nicht neutralisiert. Sie können sich im Ergebnis verstärken.
Ein Beispiel aus dem Großhandel: Sind Kundengruppen in verschiedenen Vertriebssystemen unterschiedlich gepflegt, kann eine KI zur Absatzprognose falsche Segmentmuster lernen. Das Modell liefert dann möglicherweise präzise wirkende Prognosen, deren fachliche Grundlage nicht stimmt. Der Fehler fällt oft erst auf, wenn Beschaffungs- oder Bestandsentscheidungen bereits getroffen wurden.
Entscheidend ist deshalb nicht allein die Frage, ob ein Datenfeld formal gefüllt ist. Relevant sind Vollständigkeit, fachliche Richtigkeit, Aktualität, Eindeutigkeit und Konsistenz über Systemgrenzen hinweg. Hinzu kommt die Eignung für den konkreten KI-Anwendungsfall. Eine Lieferadresse kann für die Rechnungsstellung ausreichend sein, für eine regionale Bedarfsprognose aber ungeeignet, wenn sie nicht eindeutig einer Vertriebsregion zugeordnet werden kann.
Datenqualitätsmanagement für KI Systeme beginnt beim Anwendungsfall
Viele Initiativen starten mit einer Bestandsaufnahme aller verfügbaren Daten. Das ist sinnvoll, führt allein aber selten zu einer priorisierten Umsetzung. Zielführender ist der umgekehrte Weg: Zuerst werden die fachliche Entscheidung, das KI-Ergebnis und die Folgen einer Fehlentscheidung beschrieben. Daraus ergeben sich die Datenobjekte, Qualitätsmerkmale und Kontrollen, die tatsächlich erforderlich sind.
Für eine KI-gestützte Priorisierung von Wartungsaufträgen sind beispielsweise Anlagenhistorie, Störungsmeldungen, Messwerte und Auftragsstatus relevant. Bei einer Lösung zur automatisierten Dokumentenklassifikation stehen hingegen Dokumentenqualität, Metadaten, Sprachvarianten und Freigabestatus im Mittelpunkt. Die Qualitätsregeln müssen deshalb fachlich begründet und für jeden Anwendungsfall dokumentiert werden.
Diese Anwendungsfallorientierung verhindert zwei typische Fehlentwicklungen. Erstens werden nicht alle Datenbestände mit gleichem Aufwand bereinigt, obwohl ihr Nutzen sehr unterschiedlich ist. Zweitens bleibt nicht bei allgemeinen Kennzahlen wie einer durchschnittlichen Vollständigkeitsquote stehen. Eine Quote von 98 Prozent kann unzureichend sein, wenn gerade die zwei fehlenden Prozent sicherheitsrelevante Anlagen oder umsatzkritische Kunden betreffen.
Datenherkunft und Transformationen dokumentieren
Für produktive KI-Systeme muss nachvollziehbar sein, aus welchem Quellsystem ein Datensatz stammt, wann er übernommen wurde und welche Verarbeitungsschritte erfolgt sind. Diese Datenlinie reicht von SAP-Stammdaten oder Prozessbelegen über Integrationsschichten bis in den für Training oder Inferenz verwendeten Datenbestand.
Besonders kritisch sind Transformationen, die fachliche Werte verändern: Aggregationen, Mapping-Regeln, Dublettenbereinigung, Anonymisierung oder die Ableitung neuer Merkmale. Ohne dokumentierte Logik lässt sich später weder erklären, warum ein Modell zu einem Ergebnis kam, noch zielgerichtet korrigieren, wenn ein Fehler entdeckt wird. In Projekten mit S/4HANA-Integration sollten Datenflüsse daher nicht nur technisch, sondern auch entlang der fachlichen Verantwortlichkeiten analysiert werden.
Qualitätsregeln als prüfbare Kontrollen definieren
Eine Regel wie „Kundendaten müssen korrekt sein“ ist keine steuerbare Anforderung. Prüffähig wird sie erst durch konkrete Kriterien, Grenzwerte und Maßnahmen. Beispielsweise kann für einen Prognoseprozess festgelegt werden, dass jeder aktive Artikel einer Warengruppe zugeordnet sein muss, Mengenangaben keine unzulässigen Ausreißer enthalten dürfen und Änderungen an Dispositionsparametern innerhalb eines definierten Zeitfensters verarbeitet werden.
Nicht jede Abweichung muss automatisch zur Sperre führen. Bei einem KI-System mit unterstützender Funktion kann ein Warnhinweis ausreichen, wenn Fachanwender die Empfehlung prüfen. Bei automatisierten Entscheidungen mit unmittelbarer Auswirkung auf kritische Prozesse sind strengere Freigabe- und Eskalationswege erforderlich. Die passende Kontrolle hängt vom Risiko, der Fehlerfolgen und der Möglichkeit einer menschlichen Überprüfung ab.
Rollen, Freigaben und Betrieb klar zuordnen
Datenqualität scheitert selten daran, dass niemand einen Fehler erkennen kann. Häufig bleibt offen, wer ihn fachlich bewertet, wer die Quelle korrigiert und wer entscheiden darf, ob ein fehlerhafter Datenbestand weiterhin für ein KI-System genutzt wird. Diese Lücke lässt sich nicht durch ein Dashboard schließen.
Ein tragfähiges Rollenmodell unterscheidet mindestens zwischen fachlicher Datenverantwortung, technischer Datenbereitstellung, KI-Verantwortung und Prozessverantwortung. Die fachliche Seite definiert, welche Werte für den Geschäftsprozess gültig sind. Die technische Seite verantwortet Schnittstellen, Datenpipelines und Monitoring. Die KI-Verantwortung bewertet die Auswirkungen auf Modellleistung und Einsatzgrenzen. Bei kritischen Anwendungen sollten zudem Compliance, Informationssicherheit und Datenschutz frühzeitig eingebunden werden.
Wesentlich sind eindeutige Entscheidungsrechte. Wer gibt neue Datenquellen frei? Wann ist ein Datenfehler ein operativer Incident, wann ein Grund für einen Trainingsstopp oder eine Anpassung des Modells? Welche Nachweise müssen für Prüfungen und interne Revision verfügbar sein? Solche Fragen gehören in die Betriebs- und Governance-Struktur, nicht in eine lose Sammlung von Projektfolien.
Messung muss zu Korrektur führen
Kennzahlen zur Datenqualität entfalten ihren Nutzen erst, wenn sie an konkrete Maßnahmen gekoppelt sind. Dazu gehören Fehlerquoten nach Datenobjekt, Zeit bis zur Korrektur, Anteil nicht zuordenbarer Datensätze, Regelverletzungen je Schnittstelle und die Entwicklung kritischer Abweichungen über Zeit. Für KI-Anwendungen ist zusätzlich relevant, ob sich Eingabedaten gegenüber dem Trainingsbestand verändern.
Diese Veränderung wird häufig als Data Drift bezeichnet. Sie kann entstehen, wenn neue Produktgruppen, geänderte Erfassungsprozesse oder andere Marktbedingungen die Datenstruktur verschieben. Data Drift bedeutet nicht automatisch, dass ein Modell unbrauchbar ist. Sie ist aber ein Anlass, die Modellgüte, die Gültigkeit von Schwellenwerten und mögliche Nachtrainings zu prüfen.
Revisionssicheres Reporting sollte deshalb zwei Ebenen verbinden: die operative Sicht für schnelle Korrekturen und die Governance-Sicht für Freigaben, Abweichungen und Entscheidungen. Ein Fachbereich benötigt konkrete Hinweise auf fehlerhafte Datenobjekte. Entscheider benötigen eine verdichtete Darstellung der Risiken, offenen Maßnahmen und Auswirkungen auf den KI-Betrieb.
Der praktikable Einstieg: erst Transparenz, dann Skalierung
Unternehmen müssen nicht sofort ein unternehmensweites Datenqualitätsprogramm aufbauen. Gerade unter laufendem Transformations- und Betriebsdruck ist ein klar abgegrenzter KI-Anwendungsfall häufig der bessere Startpunkt. Ein strukturierter Quick Check kann Datenquellen, kritische Qualitätslücken, Rollen, Schnittstellen und bestehende Kontrollen erfassen.
Darauf folgt eine priorisierte Umsetzung: Qualitätsregeln werden fachlich abgestimmt, Datenflüsse dokumentiert, Kontrollpunkte in bestehende Prozesse integriert und Verantwortlichkeiten verbindlich festgelegt. In laufenden SAP- oder Integrationsprojekten sollte dies mit Testmanagement, Cutover-Planung und Betriebsübergabe abgestimmt werden. Andernfalls entstehen Qualitätskontrollen, die im Projekt dokumentiert, im Produktivbetrieb aber nicht gelebt werden.
Der messbare Nutzen liegt nicht allein in höheren Datenqualitätswerten. Er zeigt sich in geringerer Nacharbeit, nachvollziehbaren Modellentscheidungen, kürzeren Reaktionszeiten bei Abweichungen und einer belastbareren Grundlage für Freigaben. Besonders bei regulierten oder geschäftskritischen KI-Anwendungen schafft diese Struktur die Voraussetzung, Leistungsfähigkeit und Steuerbarkeit gleichzeitig zu sichern.
Datenqualität im KI-Projekt belastbar organisieren
Quteco unterstützt Unternehmen mit Quick Checks, Workshops und operativer Projektbegleitung dabei, Datenflüsse, Qualitätskontrollen und Rollenmodelle für produktionsnahe KI-Anwendungen konkret aufzusetzen. Im Mittelpunkt stehen prüfbare Anforderungen, die Abstimmung mit SAP- und Integrationsprozessen sowie eine Betriebsstruktur, die auch nach dem Go-Live handlungsfähig bleibt. Der sinnvollste erste Schritt ist ein abgegrenzter Anwendungsfall, an dem sich Verantwortlichkeiten und Kontrollen praktisch erproben lassen.



