Data Cleaning richtig umsetzen - Daten zuverlässig bereinigen

Alex Eichhorn .

6. Oktober 2026

Tastatur mit Papierkorb-Symbol, Gehirn-Netzwerk, Laptop mit Dashboards. Datenbereinigung für KI-Modelle.

Eine Tabelle kann auf den ersten Blick vollständig aussehen und trotzdem falsche Ergebnisse liefern. Beim data cleaning prüfe, korrigiere und dokumentiere ich Daten so, dass Analysen, Berichte und Datenbanken verlässlich funktionieren. Hier geht es um typische Fehlerquellen, einen praxistauglichen Ablauf, geeignete Werkzeuge und die Grenzen automatischer Bereinigung.

Saubere Daten schaffen eine belastbare Grundlage für jede Analyse

  • Datenbereinigung entfernt oder korrigiert Duplikate, Tippfehler, fehlende Werte und widersprüchliche Angaben.
  • Standardisierung vereinheitlicht Formate wie Datumsangaben, Einheiten, Schreibweisen und Kategorien.
  • Validierungsregeln prüfen, ob Werte fachlich plausibel und technisch zulässig sind.
  • Dokumentation macht jede Änderung nachvollziehbar und verhindert, dass Fehler unbemerkt zurückkehren.
  • Automatisierung lohnt sich besonders bei wiederkehrenden Importen und großen Datenbeständen.

Warum ungepflegte Daten so schnell zum Problem werden

Fehlerhafte Daten wirken selten dramatisch, solange man einzelne Datensätze betrachtet. In einer Auswertung können jedoch schon wenige Prozent falscher oder fehlender Werte Trends verschieben, Kennzahlen verfälschen und Modelle unbrauchbar machen. Ein Umsatzreport mit doppelten Bestellungen ist dafür ein einfaches, aber häufiges Beispiel.

Ich unterscheide bei der Datenqualität meist sechs Dimensionen. Daten sollten korrekt, vollständig, konsistent, aktuell, eindeutig und gültig sein. Ein Datensatz kann technisch gültig sein, weil er dem erwarteten Format entspricht, aber fachlich trotzdem falsch bleiben. Die Zahl „999“ passt vielleicht in ein Zahlenfeld, ist als Alter jedoch kaum plausibel.

Besonders kritisch wird es, wenn mehrere Quellen zusammengeführt werden. Ein System speichert ein Bundesland als „Bayern“, ein anderes als „BY“ und ein drittes als „Bavaria“. Ohne Vereinheitlichung entstehen scheinbar drei Gruppen, obwohl es nur eine gibt.

Welche Fehler bei der Datenbereinigung tatsächlich auftreten

Fehlende und uneinheitliche Werte

Leere Felder sind nicht automatisch Fehler. Ein fehlendes Geburtsdatum kann bedeuten, dass die Information unbekannt ist, nicht erhoben wurde oder bewusst nicht gespeichert werden darf. Deshalb ersetze ich fehlende Werte nie pauschal durch den Mittelwert, sondern kläre zuerst ihre fachliche Bedeutung.

Auch unterschiedliche Schreibweisen führen zu Problemen. „Berlin“, „ berlin “ und „BERLIN“ können in einer Datenbank als verschiedene Werte erscheinen, wenn Leerzeichen und Großschreibung nicht bereinigt werden.

Duplikate und widersprüchliche Datensätze

Duplikate entstehen oft durch wiederholte Importe, manuelle Eingaben oder mehrere Kundennummern für dieselbe Person. Sie lassen sich nur zuverlässig erkennen, wenn es ein sinnvolles Abgleichkriterium gibt, etwa eine eindeutige Kundennummer. Name und Adresse allein reichen bei häufigen Namen meist nicht aus.

Widersprüche sind schwieriger. In einem Datensatz steht eine Lieferung als „zugestellt“, während das Rücksende-System noch „unterwegs“ meldet. Hier darf die Bereinigung nicht einfach einen Wert auswählen. Ich brauche eine definierte Priorität der Quellen oder eine fachliche Prüfung.

Ausreißer und ungültige Formate

Ausreißer sind nicht immer falsch. Ein ungewöhnlich hoher Bestellwert kann ein Eingabefehler sein, aber ebenso ein legitimer Großauftrag. Ich markiere solche Werte zunächst zur Prüfung, statt sie automatisch zu löschen. Diese Zurückhaltung schützt vor einem der häufigsten Fehler: ungewöhnliche Daten mit falschen Daten gleichzusetzen.

Problem Beispiel Sinnvolle Reaktion
Fehlender Wert Geburtsdatum leer Ursache klären, markieren oder fachgerecht imputieren
Duplikat Bestellung zweimal importiert Schlüssel prüfen und einen Datensatz nachvollziehbar entfernen
Formatfehler „31.12.2026“ und „2026-12-31“ Ein einheitliches Datumsformat verwenden
Ausreißer Alter von 240 Jahren Regel prüfen, Wert kennzeichnen und Ursache untersuchen

Der Prozess der data cleaning: Duplikate entfernen, Tippfehler korrigieren, fehlende Werte behandeln und Formate standardisieren.

So läuft eine belastbare Datenbereinigung ab

Ein guter Prozess beginnt nicht mit dem Löschen, sondern mit einer Sicherung der Rohdaten. Ich arbeite möglichst mit einer unveränderten Eingangskopie und führe die Bereinigung in einer separaten Arbeits- oder Zieltabelle durch. So bleibt nachvollziehbar, was ursprünglich geliefert wurde.

  1. Ziel festlegen: Definieren, wofür die Daten verwendet werden und welche Qualitätsanforderungen dafür gelten.
  2. Bestand untersuchen: Spalten, Datentypen, fehlende Werte, Häufigkeiten, Duplikate und Wertebereiche prüfen.
  3. Regeln definieren: Festlegen, welche Formate, Kategorien, Einheiten und Beziehungen zulässig sind.
  4. Daten standardisieren: Schreibweisen, Datumsformate, Einheiten und Feldtypen vereinheitlichen.
  5. Fehler behandeln: Korrigieren, zusammenführen, kennzeichnen oder entfernen, abhängig von der Ursache.
  6. Ergebnis validieren: Prüfen, ob die bereinigten Daten fachlich plausibel und technisch vollständig sind.
  7. Änderungen dokumentieren: Regeln, Ausnahmen, Kennzahlen und verantwortliche Personen festhalten.

Für die erste Bestandsaufnahme reichen oft einfache Kennzahlen. Ich prüfe beispielsweise den Anteil fehlender Werte pro Spalte, die Anzahl eindeutiger Datensätze, den kleinsten und größten Wert sowie die häufigsten Kategorien. Eine Spalte mit 60 Prozent fehlenden Angaben braucht eine andere Entscheidung als eine mit 0,5 Prozent.

Bei fehlenden Werten verwende ich je nach Situation drei Wege. Einzelne offensichtliche Lücken lassen sich fachlich ergänzen, statistisch imputierte Werte müssen klar gekennzeichnet werden und bei zu vielen fehlenden Angaben kann die Spalte für eine bestimmte Analyse ungeeignet sein. Einen pauschalen Grenzwert gibt es nicht, aber 20 Prozent fehlende Werte sind ein sinnvoller Anlass für eine genauere Ursachenanalyse.

Welche Werkzeuge für welchen Datenbestand passen

Das passende Werkzeug hängt weniger vom Trend als von Größe, Wiederholbarkeit und Komplexität ab. Für eine einmalige Datei mit einigen tausend Zeilen kann eine Tabellenkalkulation genügen. Bei wiederkehrenden Importen oder Millionen Datensätzen sind reproduzierbare Skripte und ETL-Prozesse deutlich sicherer.

Werkzeug Geeignet für Grenze
Tabellenkalkulation Kleine Dateien, Sichtprüfung, einfache Korrekturen Änderungen sind bei manueller Arbeit schwer reproduzierbar
SQL Bereinigung direkt in relationalen Datenbanken Komplexe Textkorrekturen benötigen zusätzliche Funktionen
Python mit Pandas Automatisierte Analysen, Transformationen und Prüfberichte Erfordert Programmierkenntnisse und saubere Umgebungen
ETL- oder ELT-Pipeline Regelmäßige Datenübernahme aus mehreren Quellen Einrichtung und Überwachung verursachen zusätzlichen Aufwand

Mein bevorzugter Ansatz bei wiederkehrenden Abläufen ist eine regelbasierte Pipeline. Jede Regel sollte ein klares Ergebnis liefern, etwa „gültig“, „korrigiert“ oder „manuelle Prüfung erforderlich“. Dadurch kann ein Team Fehlerquoten vergleichen und erkennen, ob sich eine Datenquelle dauerhaft verschlechtert.

Künstliche Intelligenz kann bei der Erkennung ähnlicher Adressen oder ungewöhnlicher Muster helfen. Ich würde solche Vorschläge aber nur kontrolliert übernehmen. Eine automatische Zusammenführung zweier Kundendatensätze kann mehr Schaden anrichten als ein nicht erkannter Tippfehler.

Validierung hält die Daten nach der Bereinigung zuverlässig

Die eigentliche Arbeit endet nicht mit der Korrektur. Danach müssen Regeln prüfen, ob die Daten weiterhin fachlich plausibel sind. Für eine Bestellung könnte das bedeuten, dass Menge und Preis positiv sind, das Lieferdatum nicht vor dem Bestelldatum liegt und jede Bestellung einem bekannten Kunden zugeordnet ist.

Technische und fachliche Prüfungen kombinieren

Technische Prüfungen kontrollieren Datentypen, Pflichtfelder, Zeichensätze und zulässige Wertebereiche. Fachliche Prüfungen gehen weiter und untersuchen Beziehungen zwischen mehreren Feldern oder Tabellen. Erst die Kombination beider Ebenen verhindert, dass formal korrekte, aber inhaltlich unsinnige Datensätze durchrutschen.

Ich dokumentiere für jede Prüfung mindestens Regel, Ergebnis, Zeitpunkt und Verantwortlichkeit. Bei wichtigen Datenbeständen sollte zusätzlich gespeichert werden, wie viele Datensätze bestanden, korrigiert oder abgewiesen wurden. Das macht Qualitätsprobleme messbar und erleichtert spätere Audits.

Lesen Sie auch: PySpark Timestamp zu Date - Der ultimative Guide für saubere Daten

Qualität dauerhaft messen

Ein monatlicher Bericht mit fünf einfachen Kennzahlen kann bereits viel bewirken. Dazu gehören der Anteil vollständiger Datensätze, die Zahl neuer Duplikate, die Fehlerquote je Quelle, die durchschnittliche Aktualität und die Zahl manueller Nachprüfungen.

Wenn die Fehlerquote nach jedem Import wieder steigt, liegt die Ursache wahrscheinlich nicht in der Bereinigung, sondern im Quellsystem oder im Prozess der Datenerfassung. Dann ist eine Eingabeprüfung am Entstehungsort meist wirksamer als eine immer aufwendigere nachträgliche Korrektur.

Typische Fehler, die ich bei der Bereinigung vermeiden würde

Der größte Irrtum ist die Annahme, dass weniger Datensätze automatisch bessere Daten bedeuten. Wer alle Zeilen mit fehlenden Werten löscht, kann systematische Verzerrungen erzeugen, weil bestimmte Gruppen häufiger unvollständige Angaben machen.

Ebenso riskant ist das Überschreiben der Originaldaten. Ohne Rohkopie und Änderungsprotokoll lässt sich später kaum erklären, warum sich eine Kennzahl verändert hat. Ich speichere deshalb nach Möglichkeit den Originalwert, den bereinigten Wert und den Grund der Änderung.

  • Duplikate nur anhand von Namen zusammenführen
  • Ausreißer ohne fachliche Prüfung löschen
  • Fehlende Werte pauschal mit 0 oder dem Mittelwert ersetzen
  • Datums- und Einheitenformate erst nach der Analyse vereinheitlichen
  • Bereinigungsregeln manuell anwenden, obwohl der Import regelmäßig wiederkehrt
  • Personenbezogene Daten ohne klare Zugriffs- und Aufbewahrungsregeln verarbeiten

Gerade die Zahl 0 ist tückisch. Sie kann „kein Wert“, „nicht zutreffend“ oder „unbekannt“ bedeuten. Diese Bedeutungen müssen getrennt bleiben, sonst wird aus einer technischen Vereinfachung schnell ein fachlicher Fehler.

Eine kleine Prüfliste für den nächsten Datenimport

Vor der Analyse stelle ich mir fünf Fragen. Woher stammen die Daten? Welche Felder sind Pflicht? Welche Werte gelten als gültig? Wie werden Duplikate erkannt? Und kann jede Änderung später erklärt werden?

Für kleine Projekte genügt oft eine Prüftabelle mit Regel, Status und Kommentar. Bei sensiblen oder regelmäßig aktualisierten Datenbeständen sollte daraus ein dokumentierter Prozess mit automatischen Tests, Rollenverteilung und einem klaren Umgang mit Ausnahmen werden.

Saubere Daten sind kein einmaliger Endzustand. Sie entstehen durch gute Eingaben, verständliche Standards, kontrollierte Transformationen und regelmäßige Qualitätsmessung. Wer diese vier Punkte verbindet, reduziert nicht nur Fehler in der Analyse, sondern schafft eine Datenbasis, auf die sich technische und geschäftliche Entscheidungen tatsächlich stützen lassen.

Häufig gestellte Fragen

Zuerst werden Ziel und Qualitätsanforderungen festgelegt, anschließend der Datenbestand untersucht und Regeln definiert. Danach folgen Standardisierung, Fehlerbehandlung, Validierung und die Dokumentation aller Änderungen. Die Rohdaten sollten dabei unverändert gesichert bleiben.
Zunächst muss geklärt werden, ob ein Wert unbekannt, nicht erhoben oder bewusst nicht gespeichert wurde. Je nach Situation kann die Lücke fachlich ergänzt, statistisch imputiert und gekennzeichnet oder für die Analyse ausgeschlossen werden. Ab etwa 20 Prozent fehlenden Werten ist eine genauere Ursachenanalyse sinnvoll.
Ein ungewöhnlicher Wert ist nicht automatisch fehlerhaft. Ein sehr hoher Bestellwert kann beispielsweise auf einen Eingabefehler oder einen legitimen Großauftrag zurückgehen. Deshalb sollten Ausreißer zunächst markiert und fachlich geprüft werden, statt sie automatisch zu löschen.
Tabellenkalkulationen eignen sich für kleine Dateien und einfache Korrekturen. SQL ist für Bereinigungen in relationalen Datenbanken geeignet, während Python mit Pandas automatisierte Analysen und Transformationen ermöglicht. Bei regelmäßigen Importen aus mehreren Quellen sind ETL- oder ELT-Pipelines sinnvoll, weil sie Regeln reproduzierbar anwenden.
Artikel bewerten

Durchschnitt: 0.0 / 5 · 0 Bewertungen

Tags

datenbereinigung duplikate etl datenqualität validierung
Autor Alex Eichhorn
Alex Eichhorn
Mein Name ist Alex Eichhorn und ich habe sechs Jahre Erfahrung in den Bereichen Informatik, Naturwissenschaften und moderne Technologien. Schon früh entwickelte ich eine Faszination für die Wechselwirkungen zwischen Technologie und unserem Alltag. Diese Leidenschaft treibt mich an, komplexe Themen verständlich zu machen und Leser bei der Entschlüsselung aktueller Trends zu unterstützen. Ich schreibe über verschiedene Aspekte der Informatik und Naturwissenschaften, wobei ich großen Wert auf die Genauigkeit und Aktualität der Informationen lege. Mein Ansatz besteht darin, Quellen sorgfältig zu prüfen und schwierige Konzepte zu vereinfachen, damit sie für jeden zugänglich sind. Ich glaube daran, dass Wissen klar und strukturiert vermittelt werden sollte, um einen echten Mehrwert zu bieten.
Kommentare (0)
Kommentar hinzufügen