Anmeldung Registrierung
Auto Hell Dunkel
Erweiterte Suche
  1. Startseite
  2. Podcasts
  3. Data Science Deep Dive Podcast
  4. #86: "Garbage In, Garbage Out" verhindern: Datenvalidierung richtig gemacht
In dieser Episode dreht sich alles um Datenvalidierung und darum,
wie sich das Prinzip "Garbage In, Garbage Out" vermeiden lässt.
Mira und Michelle erklären, warum eine gründliche Prüfung der
Datenqualität direkt zu Projektbeginn entscheidend ist. Im Fokus
stehen typische Checks wie Schema-Validierung, Vollständigkeit,
Konsistenz und statistische Auffälligkeiten. Außerdem geht es
darum, wie Datenvalidierung hilft, Daten besser zu verstehen und
Fehler frühzeitig aufzudecken. Abschließend werden praktische
Techniken und Tools vorgestellt, die von manueller Analyse bis
zur automatisierten Pipeline reichen.

**Zusammenfassung**

Datenvalidierung prüft die Datenqualität vor der Modellierung

Ziel: Probleme früh erkennen und Ressourcen sparen

Wichtige Aspekte: Datentypen, Duplikate, fehlende Werte

Logik- und Plausibilitätschecks (z.B. Alter nicht negativ,
Prozentwerte im richtigen Bereich)

Statistische Methoden zur Erkennung von Anomalien und
Verteilungen

Univariat: einfache Kennzahlen, Histogramme, Boxplots,
Zeitreihenanalysen

Multivariat: Korrelationen, Scatterplots, Kreuztabellen,
Multikollinearität

Tools reichen von Notebooks und Reports bis zu Dashboards und
automatisierten Pipelines

**Links**

Great Expectations (Datenvalidierung in Python):
https://greatexpectations.io/

Pandera (Schema-Validierung für Pandas):
https://pandera.readthedocs.io/

dataMaid (Datenvalidierung in R):
https://cran.r-project.org/web/packages/dataMaid/index.html

Pydantic (Datenvalidierung & Settings in Python):
https://docs.pydantic.dev/

Wikipedia-Eintrag zum Prinzip "Garbage In, Garbage Out":
https://de.wikipedia.org/wiki/Garbage_In,_Garbage_Out
Episode melden

„#86: "Garbage In, Garbage Out" verhindern: Datenvalidierung richtig gemacht“

Worum geht es? Danach fragen wir noch nach dem Grund.

Abonnenten

Ad
Berlin, Deutschland

Teilen

Mein Archiv

Deine Privatkopie der Folgen, die du nicht verlieren willst.

Podcast-Folgen verschwinden. Feeds werden auf die letzten Episoden gekürzt, Hoster räumen alte Dateien ab, Formate wechseln den Anbieter und lassen ihr Archiv zurück. Mit „Mein Archiv“ sichert podcast.de die Folgen deiner Podcasts für dich — angefangen bei den ältesten, denn die sind zuerst weg.

  • Deine gesicherten Folgen bleiben hörbar, auch wenn das Original offline geht.
  • Auch Folgen, die im heutigen Feed gar nicht mehr stehen — podcast.de kennt sie noch.
  • Herunterladen bleibt möglich, solange die Folge beim Podcaster liegt. Der zählt seine Abrufe wie bisher.
Startet bald

Sei beim Start von Mein Archiv dabei

Mein Archiv ist fast fertig. Trag dich ein, dann bekommst du eine E-Mail, sobald es losgeht – und bist von Anfang an dabei. Wir schreiben dir nur zum Start, keine Werbung, keine Weitergabe deiner Daten.

Du bekommst zuerst eine Bestätigungsmail. Abmelden geht jederzeit. Datenschutz