Eine Tabelle kann auf den ersten Blick vollständig aussehen und trotzdem falsche Ergebnisse liefern. Beim data cleaning prüfe, korrigiere und dokumentiere ich Daten so, dass Analysen, Berichte und Datenbanken verlässlich funktionieren. Hier geht es um typische Fehlerquellen, einen praxistauglichen Ablauf, geeignete Werkzeuge und die Grenzen automatischer Bereinigung.
Saubere Daten schaffen eine belastbare Grundlage für jede Analyse
- Datenbereinigung entfernt oder korrigiert Duplikate, Tippfehler, fehlende Werte und widersprüchliche Angaben.
- Standardisierung vereinheitlicht Formate wie Datumsangaben, Einheiten, Schreibweisen und Kategorien.
- Validierungsregeln prüfen, ob Werte fachlich plausibel und technisch zulässig sind.
- Dokumentation macht jede Änderung nachvollziehbar und verhindert, dass Fehler unbemerkt zurückkehren.
- Automatisierung lohnt sich besonders bei wiederkehrenden Importen und großen Datenbeständen.
Warum ungepflegte Daten so schnell zum Problem werden
Fehlerhafte Daten wirken selten dramatisch, solange man einzelne Datensätze betrachtet. In einer Auswertung können jedoch schon wenige Prozent falscher oder fehlender Werte Trends verschieben, Kennzahlen verfälschen und Modelle unbrauchbar machen. Ein Umsatzreport mit doppelten Bestellungen ist dafür ein einfaches, aber häufiges Beispiel.
Ich unterscheide bei der Datenqualität meist sechs Dimensionen. Daten sollten korrekt, vollständig, konsistent, aktuell, eindeutig und gültig sein. Ein Datensatz kann technisch gültig sein, weil er dem erwarteten Format entspricht, aber fachlich trotzdem falsch bleiben. Die Zahl „999“ passt vielleicht in ein Zahlenfeld, ist als Alter jedoch kaum plausibel.
Besonders kritisch wird es, wenn mehrere Quellen zusammengeführt werden. Ein System speichert ein Bundesland als „Bayern“, ein anderes als „BY“ und ein drittes als „Bavaria“. Ohne Vereinheitlichung entstehen scheinbar drei Gruppen, obwohl es nur eine gibt.
Welche Fehler bei der Datenbereinigung tatsächlich auftreten
Fehlende und uneinheitliche Werte
Leere Felder sind nicht automatisch Fehler. Ein fehlendes Geburtsdatum kann bedeuten, dass die Information unbekannt ist, nicht erhoben wurde oder bewusst nicht gespeichert werden darf. Deshalb ersetze ich fehlende Werte nie pauschal durch den Mittelwert, sondern kläre zuerst ihre fachliche Bedeutung.
Auch unterschiedliche Schreibweisen führen zu Problemen. „Berlin“, „ berlin “ und „BERLIN“ können in einer Datenbank als verschiedene Werte erscheinen, wenn Leerzeichen und Großschreibung nicht bereinigt werden.
Duplikate und widersprüchliche Datensätze
Duplikate entstehen oft durch wiederholte Importe, manuelle Eingaben oder mehrere Kundennummern für dieselbe Person. Sie lassen sich nur zuverlässig erkennen, wenn es ein sinnvolles Abgleichkriterium gibt, etwa eine eindeutige Kundennummer. Name und Adresse allein reichen bei häufigen Namen meist nicht aus.
Widersprüche sind schwieriger. In einem Datensatz steht eine Lieferung als „zugestellt“, während das Rücksende-System noch „unterwegs“ meldet. Hier darf die Bereinigung nicht einfach einen Wert auswählen. Ich brauche eine definierte Priorität der Quellen oder eine fachliche Prüfung.
Ausreißer und ungültige Formate
Ausreißer sind nicht immer falsch. Ein ungewöhnlich hoher Bestellwert kann ein Eingabefehler sein, aber ebenso ein legitimer Großauftrag. Ich markiere solche Werte zunächst zur Prüfung, statt sie automatisch zu löschen. Diese Zurückhaltung schützt vor einem der häufigsten Fehler: ungewöhnliche Daten mit falschen Daten gleichzusetzen.
| Problem | Beispiel | Sinnvolle Reaktion |
|---|---|---|
| Fehlender Wert | Geburtsdatum leer | Ursache klären, markieren oder fachgerecht imputieren |
| Duplikat | Bestellung zweimal importiert | Schlüssel prüfen und einen Datensatz nachvollziehbar entfernen |
| Formatfehler | „31.12.2026“ und „2026-12-31“ | Ein einheitliches Datumsformat verwenden |
| Ausreißer | Alter von 240 Jahren | Regel prüfen, Wert kennzeichnen und Ursache untersuchen |

So läuft eine belastbare Datenbereinigung ab
Ein guter Prozess beginnt nicht mit dem Löschen, sondern mit einer Sicherung der Rohdaten. Ich arbeite möglichst mit einer unveränderten Eingangskopie und führe die Bereinigung in einer separaten Arbeits- oder Zieltabelle durch. So bleibt nachvollziehbar, was ursprünglich geliefert wurde.
- Ziel festlegen: Definieren, wofür die Daten verwendet werden und welche Qualitätsanforderungen dafür gelten.
- Bestand untersuchen: Spalten, Datentypen, fehlende Werte, Häufigkeiten, Duplikate und Wertebereiche prüfen.
- Regeln definieren: Festlegen, welche Formate, Kategorien, Einheiten und Beziehungen zulässig sind.
- Daten standardisieren: Schreibweisen, Datumsformate, Einheiten und Feldtypen vereinheitlichen.
- Fehler behandeln: Korrigieren, zusammenführen, kennzeichnen oder entfernen, abhängig von der Ursache.
- Ergebnis validieren: Prüfen, ob die bereinigten Daten fachlich plausibel und technisch vollständig sind.
- Änderungen dokumentieren: Regeln, Ausnahmen, Kennzahlen und verantwortliche Personen festhalten.
Für die erste Bestandsaufnahme reichen oft einfache Kennzahlen. Ich prüfe beispielsweise den Anteil fehlender Werte pro Spalte, die Anzahl eindeutiger Datensätze, den kleinsten und größten Wert sowie die häufigsten Kategorien. Eine Spalte mit 60 Prozent fehlenden Angaben braucht eine andere Entscheidung als eine mit 0,5 Prozent.
Bei fehlenden Werten verwende ich je nach Situation drei Wege. Einzelne offensichtliche Lücken lassen sich fachlich ergänzen, statistisch imputierte Werte müssen klar gekennzeichnet werden und bei zu vielen fehlenden Angaben kann die Spalte für eine bestimmte Analyse ungeeignet sein. Einen pauschalen Grenzwert gibt es nicht, aber 20 Prozent fehlende Werte sind ein sinnvoller Anlass für eine genauere Ursachenanalyse.
Welche Werkzeuge für welchen Datenbestand passen
Das passende Werkzeug hängt weniger vom Trend als von Größe, Wiederholbarkeit und Komplexität ab. Für eine einmalige Datei mit einigen tausend Zeilen kann eine Tabellenkalkulation genügen. Bei wiederkehrenden Importen oder Millionen Datensätzen sind reproduzierbare Skripte und ETL-Prozesse deutlich sicherer.
| Werkzeug | Geeignet für | Grenze |
|---|---|---|
| Tabellenkalkulation | Kleine Dateien, Sichtprüfung, einfache Korrekturen | Änderungen sind bei manueller Arbeit schwer reproduzierbar |
| SQL | Bereinigung direkt in relationalen Datenbanken | Komplexe Textkorrekturen benötigen zusätzliche Funktionen |
| Python mit Pandas | Automatisierte Analysen, Transformationen und Prüfberichte | Erfordert Programmierkenntnisse und saubere Umgebungen |
| ETL- oder ELT-Pipeline | Regelmäßige Datenübernahme aus mehreren Quellen | Einrichtung und Überwachung verursachen zusätzlichen Aufwand |
Mein bevorzugter Ansatz bei wiederkehrenden Abläufen ist eine regelbasierte Pipeline. Jede Regel sollte ein klares Ergebnis liefern, etwa „gültig“, „korrigiert“ oder „manuelle Prüfung erforderlich“. Dadurch kann ein Team Fehlerquoten vergleichen und erkennen, ob sich eine Datenquelle dauerhaft verschlechtert.
Künstliche Intelligenz kann bei der Erkennung ähnlicher Adressen oder ungewöhnlicher Muster helfen. Ich würde solche Vorschläge aber nur kontrolliert übernehmen. Eine automatische Zusammenführung zweier Kundendatensätze kann mehr Schaden anrichten als ein nicht erkannter Tippfehler.
Validierung hält die Daten nach der Bereinigung zuverlässig
Die eigentliche Arbeit endet nicht mit der Korrektur. Danach müssen Regeln prüfen, ob die Daten weiterhin fachlich plausibel sind. Für eine Bestellung könnte das bedeuten, dass Menge und Preis positiv sind, das Lieferdatum nicht vor dem Bestelldatum liegt und jede Bestellung einem bekannten Kunden zugeordnet ist.
Technische und fachliche Prüfungen kombinieren
Technische Prüfungen kontrollieren Datentypen, Pflichtfelder, Zeichensätze und zulässige Wertebereiche. Fachliche Prüfungen gehen weiter und untersuchen Beziehungen zwischen mehreren Feldern oder Tabellen. Erst die Kombination beider Ebenen verhindert, dass formal korrekte, aber inhaltlich unsinnige Datensätze durchrutschen.
Ich dokumentiere für jede Prüfung mindestens Regel, Ergebnis, Zeitpunkt und Verantwortlichkeit. Bei wichtigen Datenbeständen sollte zusätzlich gespeichert werden, wie viele Datensätze bestanden, korrigiert oder abgewiesen wurden. Das macht Qualitätsprobleme messbar und erleichtert spätere Audits.
Lesen Sie auch: PySpark Timestamp zu Date - Der ultimative Guide für saubere Daten
Qualität dauerhaft messen
Ein monatlicher Bericht mit fünf einfachen Kennzahlen kann bereits viel bewirken. Dazu gehören der Anteil vollständiger Datensätze, die Zahl neuer Duplikate, die Fehlerquote je Quelle, die durchschnittliche Aktualität und die Zahl manueller Nachprüfungen.
Wenn die Fehlerquote nach jedem Import wieder steigt, liegt die Ursache wahrscheinlich nicht in der Bereinigung, sondern im Quellsystem oder im Prozess der Datenerfassung. Dann ist eine Eingabeprüfung am Entstehungsort meist wirksamer als eine immer aufwendigere nachträgliche Korrektur.
Typische Fehler, die ich bei der Bereinigung vermeiden würde
Der größte Irrtum ist die Annahme, dass weniger Datensätze automatisch bessere Daten bedeuten. Wer alle Zeilen mit fehlenden Werten löscht, kann systematische Verzerrungen erzeugen, weil bestimmte Gruppen häufiger unvollständige Angaben machen.
Ebenso riskant ist das Überschreiben der Originaldaten. Ohne Rohkopie und Änderungsprotokoll lässt sich später kaum erklären, warum sich eine Kennzahl verändert hat. Ich speichere deshalb nach Möglichkeit den Originalwert, den bereinigten Wert und den Grund der Änderung.
- Duplikate nur anhand von Namen zusammenführen
- Ausreißer ohne fachliche Prüfung löschen
- Fehlende Werte pauschal mit 0 oder dem Mittelwert ersetzen
- Datums- und Einheitenformate erst nach der Analyse vereinheitlichen
- Bereinigungsregeln manuell anwenden, obwohl der Import regelmäßig wiederkehrt
- Personenbezogene Daten ohne klare Zugriffs- und Aufbewahrungsregeln verarbeiten
Gerade die Zahl 0 ist tückisch. Sie kann „kein Wert“, „nicht zutreffend“ oder „unbekannt“ bedeuten. Diese Bedeutungen müssen getrennt bleiben, sonst wird aus einer technischen Vereinfachung schnell ein fachlicher Fehler.
Eine kleine Prüfliste für den nächsten Datenimport
Vor der Analyse stelle ich mir fünf Fragen. Woher stammen die Daten? Welche Felder sind Pflicht? Welche Werte gelten als gültig? Wie werden Duplikate erkannt? Und kann jede Änderung später erklärt werden?
Für kleine Projekte genügt oft eine Prüftabelle mit Regel, Status und Kommentar. Bei sensiblen oder regelmäßig aktualisierten Datenbeständen sollte daraus ein dokumentierter Prozess mit automatischen Tests, Rollenverteilung und einem klaren Umgang mit Ausnahmen werden.
Saubere Daten sind kein einmaliger Endzustand. Sie entstehen durch gute Eingaben, verständliche Standards, kontrollierte Transformationen und regelmäßige Qualitätsmessung. Wer diese vier Punkte verbindet, reduziert nicht nur Fehler in der Analyse, sondern schafft eine Datenbasis, auf die sich technische und geschäftliche Entscheidungen tatsächlich stützen lassen.