Wenn ein Unternehmen nach einer Preissenkung mehr Bestellungen verzeichnet, ist damit noch nicht bewiesen, dass der niedrigere Preis die Ursache war. Vielleicht lief gleichzeitig eine Werbekampagne, die Nachfrage stieg saisonal oder besonders kaufbereite Kunden wurden gezielt angesprochen. Causal inference, auf Deutsch kausale Inferenz, hilft dabei, den eigenständigen Effekt einer Maßnahme von bloßen Zusammenhängen zu trennen und aus Daten belastbare Entscheidungen abzuleiten.
Belastbare Ursache-Wirkungs-Analysen brauchen klare Fragen und passende Daten
- Kausalität fragt, was sich durch eine konkrete Intervention verändert hätte.
- Korrelation zeigt einen Zusammenhang, beweist aber keine Ursache.
- Randomisierte Experimente liefern meist die sauberste Grundlage für kausale Aussagen.
- Beobachtungsdaten benötigen Annahmen, Kontrollvariablen und sorgfältige Prüfungen.
- Datenbanken beeinflussen das Ergebnis durch Zeitstempel, Auswahlregeln und Datenqualität.

Was kausale Inferenz von Korrelation unterscheidet
Bei einer Korrelation bewegen sich zwei Merkmale gemeinsam. Das kann nützlich sein, beantwortet aber nicht die Frage, was passiert wäre, wenn man gezielt eingegriffen hätte. Bei einer kausalen Analyse interessiert mich deshalb nicht nur, ob zwei Variablen zusammenhängen, sondern wie sich das Ergebnis durch eine bestimmte Maßnahme verändert.
Ein einfaches Beispiel macht den Unterschied sichtbar. Kunden, die einen Newsletter erhalten, kaufen möglicherweise häufiger ein. Daraus folgt noch nicht, dass der Newsletter den Kauf ausgelöst hat. Vielleicht erhalten vor allem bereits aktive Kunden den Newsletter. Diese zusätzliche Variable ist ein Confounder, also ein Einflussfaktor, der sowohl die Maßnahme als auch das Ergebnis beeinflusst.
In der Praxis formuliere ich die Frage möglichst konkret. Nicht „Wirkt Marketing?“, sondern etwa „Wie verändert eine zusätzliche E-Mail pro Woche innerhalb von 30 Tagen den Umsatz bestehender Kunden mit mindestens einem Kauf im letzten Quartal?“. Dadurch werden Maßnahme, Zielgruppe, Zeitraum und Ergebnis messbar.
Der kontrafaktische Gedanke
Die zentrale Idee lautet kontrafaktisch. Für dieselbe Person oder denselben Kunden möchte man vergleichen, was mit Maßnahme und was ohne Maßnahme passiert wäre. Beobachtet wird jedoch immer nur eine der beiden Möglichkeiten. Genau deshalb entsteht das methodische Problem, den fehlenden Vergleich plausibel zu rekonstruieren.
Der durchschnittliche Behandlungseffekt, häufig als ATE bezeichnet, beschreibt den mittleren Unterschied zwischen diesen beiden Szenarien in einer Zielpopulation. Für eine konkrete Entscheidung kann aber auch der Effekt bei bereits behandelten Personen, der ATT, wichtiger sein. Ich halte diese Unterscheidung für entscheidend, weil ein Angebot für alle Kunden anders wirken kann als für jene, die es ohnehin genutzt haben.
Wie eine kausale Analyse von der Frage zum Ergebnis führt
Eine gute Analyse beginnt nicht mit einem statistischen Modell, sondern mit einer präzisen Interventionsfrage. Zuerst lege ich fest, was als Behandlung gilt, welches Ergebnis gemessen wird und welche Population betrachtet werden soll. „Nutzung der Plattform“ ist beispielsweise zu ungenau, wenn nicht klar ist, ob ein Login, eine aktive Sitzung oder eine bestimmte Funktion gemeint ist.
- Ursache und Ergebnis definieren. Bestimme die Intervention, den Beobachtungszeitraum und eine messbare Zielgröße.
- Zielpopulation festlegen. Kläre, für welche Kunden, Patienten, Standorte oder Zeiträume das Ergebnis gelten soll.
- Kausales Modell skizzieren. Ein gerichteter azyklischer Graph, kurz DAG, zeigt angenommene Beziehungen zwischen Variablen.
- Störfaktoren prüfen. Suche Variablen, die sowohl die Behandlung als auch das Ergebnis beeinflussen.
- Schätzmethode auswählen. Die Methode muss zur Datenentstehung und zur Fragestellung passen.
- Robustheit testen. Prüfe fehlende Werte, alternative Spezifikationen, Ausreißer und mögliche unbeobachtete Confounder.
Der DAG ist dabei kein dekoratives Diagramm. Er hilft zu entscheiden, welche Variablen kontrolliert werden sollten und welche gerade nicht. Eine Variable, die erst durch die Behandlung entsteht, kann ein Teil des Behandlungseffekts sein. Wer sie unkritisch kontrolliert, entfernt möglicherweise genau den Effekt, den er messen wollte.
Ich dokumentiere außerdem vor der Modellierung, welche Kennzahl tatsächlich geschätzt werden soll. Ein Ergebnis wie „Die Kampagne erhöhte den Umsatz um 8 Prozent“ ist ohne Zielgruppe, Vergleichszeitraum und Unsicherheitsintervall kaum belastbar. Aussagekräftiger ist eine Formulierung wie „geschätzter Mehrumsatz pro aktivem Kunden innerhalb von 30 Tagen“.
Warum Signifikanz allein nicht genügt
Ein kleiner p-Wert beantwortet nicht automatisch die Frage, ob ein Ergebnis praktisch wichtig oder kausal glaubwürdig ist. Bei sehr großen Datenmengen können winzige Effekte statistisch signifikant werden, obwohl sie für eine Geschäftsentscheidung keine Rolle spielen. Deshalb betrachte ich immer Effektgröße, Konfidenzintervall und praktische Relevanz gemeinsam.
Ein breites Intervall kann trotz eines positiven Schätzwerts zeigen, dass die Daten noch keine sichere Entscheidung erlauben. Umgekehrt kann ein moderater Effekt mit engem Intervall für die Planung wichtiger sein als ein spektakulärer, aber sehr unsicherer Wert.
Welche Methoden sich für welche Daten eignen
Es gibt keine universell beste Methode. Entscheidend ist, wie die Daten entstanden sind und ob die Voraussetzungen der jeweiligen Methode plausibel erfüllt werden. Die folgende Übersicht hilft bei der ersten Einordnung.
| Methode | Geeignet für | Stärke | Wichtige Grenze |
|---|---|---|---|
| Randomisiertes Experiment | Zufällig zugewiesene Maßnahmen | Gute Kontrolle von Confounding | Nicht immer ethisch, technisch oder wirtschaftlich möglich |
| Regressionsanpassung | Beobachtungsdaten mit gut gemessenen Einflussfaktoren | Flexibel und leicht in bestehende Analysen integrierbar | Unbeobachtete Confounder bleiben problematisch |
| Matching und Propensity Score | Behandelte und unbehandelte Einheiten mit ähnlichen Merkmalen | Vergleich vergleichbarer Gruppen | Nur gemessene Merkmale können ausgeglichen werden |
| Difference-in-Differences | Gruppen mit Einführung einer Maßnahme zu unterschiedlichen Zeitpunkten | Nutzt Veränderungen vor und nach der Intervention | Benötigt plausibel parallele Trends vor der Maßnahme |
| Instrumentvariablen | Starke unbeobachtete Verzerrung bei vorhandenem Instrument | Kann bestimmte unbeobachtete Störfaktoren umgehen | Gültige Instrumente sind selten und schwer zu begründen |
| Regressionsdiskontinuität | Behandlung ab einem festen Schwellenwert | Vergleicht Fälle knapp oberhalb und unterhalb der Grenze | Gilt häufig nur lokal nahe am Schwellenwert |
Ein kontrollierter A/B-Test ist meist die erste Wahl, wenn eine zufällige Zuweisung möglich ist. Durch die Randomisierung unterscheiden sich die Gruppen im Durchschnitt nur zufällig, sodass der Unterschied im Ergebnis besser der Intervention zugeschrieben werden kann. Trotzdem bleiben Probleme wie Abbrüche, Nichtbefolgung der Zuweisung und wechselnde Messdefinitionen bestehen.
Bei historischen Kundendaten ist eine Regression oft der praktischere Einstieg. Sie kann Alter, Region, bisherige Käufe oder Nutzungshäufigkeit berücksichtigen. Ich würde mich aber nie mit einem hohen R²-Wert beruhigen lassen, denn gute Vorhersage ist nicht dasselbe wie gute Kausalität.
Difference-in-Differences eignet sich etwa, wenn eine Filiale ein neues Kassensystem erhält und andere Filialen zunächst als Vergleich dienen. Der entscheidende Prüfpunkt ist, ob sich die Gruppen vor der Einführung ähnlich entwickelt haben. Ohne diese Annahme kann der gemessene Vorher-Nachher-Unterschied eine andere Ursache haben.
Warum Datenbanken über die Aussagekraft entscheiden
Viele kausale Analysen scheitern nicht an der Statistik, sondern an der Datenbasis. In einer Datenbank muss klar sein, welche Zeile welche Einheit repräsentiert. Eine Tabelle mit mehreren Bestellungen pro Kunde ist keine Kundentabelle. Werden solche Daten ohne Aggregation verbunden, zählen häufige Käufer stärker und der Effekt wird verzerrt.
Zeitliche Reihenfolge sauber abbilden
Die Ursache muss vor dem Ergebnis liegen. Deshalb prüfe ich Zeitstempel, Zeitzonen, verspätete Buchungen und nachträgliche Korrekturen. Ein Modell, das bereits den Umsatz nach einer Kampagne verwendet, um die Teilnahme an dieser Kampagne zu erklären, enthält Datenleckage. Das Ergebnis kann dann beeindruckend aussehen und trotzdem unbrauchbar sein.
Besonders wichtig ist ein klarer Stichtag. Für jeden Datensatz sollte erkennbar sein, welche Informationen zum Zeitpunkt der Entscheidung tatsächlich verfügbar waren. Nachträglich angereicherte Daten dürfen nicht unbemerkt in eine historische Analyse einfließen.
Joins, fehlende Werte und Auswahlverzerrung
Ein Inner Join kann Personen aus der Analyse entfernen, wenn zu ihnen kein Datensatz in einer zweiten Tabelle existiert. Das wirkt zunächst sauber, verändert aber möglicherweise die Zielpopulation. Ich prüfe deshalb vor und nach jedem Join die Anzahl der Einheiten, die Verteilung wichtiger Merkmale und den Anteil fehlender Werte.
Auch fehlende Daten sind selten völlig zufällig. Wenn unzufriedene Kunden häufiger keine Bewertung abgeben, kann eine Analyse der vorhandenen Bewertungen zu optimistisch ausfallen. Eine kurze Datenprüfung mit Abdeckungsquoten, Duplikaten und Ausfallmustern ist oft wertvoller als ein komplexeres Modell.
Lesen Sie auch: PySpark Timestamp zu Date - Der ultimative Guide für saubere Daten
Ein praktisches Datenmodell
Für viele Anwendungen reichen zunächst vier logisch getrennte Ebenen. Eine Tabelle beschreibt die Einheiten, eine zweite die Interventionen, eine dritte die Ergebnisse und eine vierte zeitabhängige Einflussfaktoren. So lässt sich nachvollziehen, wann eine Maßnahme stattfand und welche Informationen zu diesem Zeitpunkt bekannt waren.
Ich versioniere außerdem Analyseabfragen und halte Filterregeln fest. Eine scheinbar kleine Änderung, etwa „nur aktive Kunden“ statt „alle Kunden“, kann die geschätzte Zielgruppe und damit den Effekt deutlich verändern. Reproduzierbarkeit ist hier kein Luxus, sondern eine Voraussetzung für Vertrauen.
Typische Fehler und die Grenzen kausaler Aussagen
Der häufigste Fehler ist, jede beobachtete Differenz als Wirkung zu interpretieren. Wenn Nutzer einer Premiumfunktion mehr Umsatz erzeugen, kann das an der Funktion liegen, aber ebenso an ihrer höheren Zahlungsbereitschaft. Mehr Daten lösen dieses Problem nicht automatisch. Mehr Beobachtungen ersetzen keine plausible Identifikationsstrategie.
- Post-Treatment-Variablen kontrollieren: Variablen, die erst nach der Maßnahme entstehen, können einen Teil der Wirkung verdecken.
- Survivorship Bias: Nur noch aktive Kunden zu untersuchen, ignoriert möglicherweise jene, die abgesprungen sind.
- Simpson-Paradoxon: Ein Gesamteffekt kann sich umkehren, wenn Gruppen mit stark unterschiedlichen Größen zusammengelegt werden.
- Multiple Testing: Wer sehr viele Kennzahlen und Segmente prüft, findet leicht zufällige Treffer.
- Schlechte Vergleichsgruppen: Eine Kontrollgruppe mit anderer Ausgangslage liefert keinen fairen Vergleich.
- Unklare Übertragbarkeit: Ein Effekt in einer Region oder Kundengruppe gilt nicht automatisch überall.
Bei Beobachtungsdaten sollte ich immer offenlegen, welche Annahme die Schlussfolgerung trägt. Dazu gehören etwa ausreichende Überlappung zwischen behandelten und unbehandelten Einheiten, eine korrekte zeitliche Reihenfolge und die Annahme, dass wichtige Confounder gemessen wurden. Sensitivitätsanalysen zeigen, wie stark ein unbeobachteter Einfluss sein müsste, um das Ergebnis zu kippen.
Auch maschinelles Lernen ist kein Freifahrtschein. Flexible Modelle können heterogene Effekte entdecken und viele Merkmale verarbeiten, aber sie lernen zunächst Muster in den Daten. Ohne kausales Design, klare Zielgröße und sorgfältige Validierung erzeugen sie möglicherweise sehr präzise Antworten auf die falsche Frage.
Wie ich Ergebnisse verständlich und fair kommuniziere
Ein gutes Ergebnis beschreibt nicht nur eine Zahl, sondern auch deren Bedeutung und Reichweite. Statt „Die Maßnahme wirkt“ schreibe ich lieber, für welche Population, welchen Zeitraum und welches Ergebnis ein Effekt geschätzt wurde. Das zwingt zur nötigen Präzision und verhindert überzogene Versprechen.
Zu jeder Schätzung gehören mindestens die Vergleichsgruppen, die Einheit des Effekts und eine Unsicherheitsangabe. Wenn die Daten keine belastbare Aussage erlauben, ist „nicht eindeutig bestimmbar“ die bessere Antwort als eine scheinbar exakte Prozentzahl.
Für interne Entscheidungen nutze ich gern eine kompakte Ergebnisstruktur mit vier Fragen:
- Welche konkrete Intervention wurde untersucht?
- Mit welcher Gruppe oder welchem Zeitraum wurde verglichen?
- Welche Annahmen sind für die Interpretation notwendig?
- Was würde ich als Nächstes testen, um die Unsicherheit zu reduzieren?
Diese letzte Frage wird oft unterschätzt. Eine Analyse muss nicht sofort die endgültige Wahrheit liefern. Sie kann zeigen, ob ein kontrollierter Test sinnvoll ist, welche Daten fehlen oder welche Kundengruppe besonders unterschiedlich reagiert. So wird aus Statistik ein praktischer Entscheidungsprozess.
Eine gute Kausalanalyse beginnt mit einer ehrlichen Datenfrage
Wer Ursache und Wirkung aus Daten ableiten möchte, braucht vor allem drei Dinge. Eine exakt formulierte Intervention, eine Datenbasis mit nachvollziehbarer zeitlicher und struktureller Ordnung sowie ein Verfahren, dessen Annahmen zum Entstehungsprozess der Daten passen.
Mein wichtigster Rat lautet deshalb, vor dem Modellieren innezuhalten. Erst wenn klar ist, was verändert wurde, bei wem es verändert wurde und welches Ergebnis interessiert, lohnt sich die Wahl zwischen Experiment, Regression, Matching oder einem quasi-experimentellen Design. Die Qualität der kausalen Aussage entsteht größtenteils vor dem ersten Modelllauf.
Am Ende ist eine vorsichtige, gut begründete Aussage wertvoller als eine spektakuläre Zahl ohne belastbaren Vergleich. Genau darin liegt die Stärke kausaler Analyse in Datenbanken und modernen Data-Science-Projekten.