Folge 100 bündelt, was Entscheider*innen über Data Science wissen
sollten – aufgeteilt in vier Blöcke: Begriffsklärung,
Datenqualität, Modellgüte und Erfolgsfaktoren. Mira und Amit
ordnen ein, wie KI, Machine Learning und Statistik
zusammenhängen, was supervised von unsupervised Learning
unterscheidet und welche der vier Stufen der Datenanalyse für
welche Fragestellung überhaupt nötig ist. Beim Thema Daten geht
es um Validierung vor der eigentlichen Analyse, fehlende
Zielvariablen und typische Formatprobleme, bei der Modellgüte um
passende Gütemaße, Benchmarks, Overfitting, Explainability und
die Evaluation von GenAI. Der letzte Teil behandelt die Frage,
warum Datenprojekte in der Schublade landen: Auswahl des Use
Cases, der Aufwandssprung von PoC zu MVP und Produkt sowie der
eigene Data-Maturity-Level. Zum Abschluss stehen die fünf
häufigsten Fehler.
**Zusammenfassung**
Begriffe sortieren: KI ist als Überbegriff meist unscharf
gemeint, zwischen Statistik und ML gibt es einen fließenden
Übergang – entscheidend ist, ob Zusammenhänge verstanden oder
Prognosen erstellt werden sollen.
Vier Stufen der Datenanalyse: deskriptiv, diagnostisch,
prädiktiv, präskriptiv – oft liefert schon die erste Stufe den
Großteil der Erkenntnisse, Stufen lassen sich schlecht
überspringen.
Datenqualität vor Datenquantität: viele korrekte, aber
irrelevante Spalten verbessern keine Prognose; fehlerhafte Daten
sind das größere Problem – gilt für tabulare Daten wie für
RAG-Dokumente.
Validierung zuerst: explorative Analysen, Verteilungen und
Ausreißerprüfung deckt Datenprobleme auf und erzeugt selbst schon
Erkenntnisse.
Das Gütemaß hängt vom Use Case ab: Kosten von False Positives
und False Negatives unterscheiden sich, ein einfaches
Benchmark-Modell zeigt, ob der Aufwand sich lohnt.
Overfitting vermeiden: immer out-of-sample auf einem
Testdatensatz evaluieren und zeitliche Struktur berücksichtigen –
sonst sind Prognosen ungenauer als erwartet und man sieht
Zusammenhänge, die es nicht gibt.
GenAI-Evaluation ist der Engpass: ein PoC entsteht schnell,
das MVP wird durch Bewertungsfragen (LLM as a Judge, User
Testing) deutlich aufwändiger.
Erfolgsfaktoren: konkreter Use Case mit messbarem Hebel,
frühe Einbindung der Nutzer*innen, Implementierung von Anfang an
mitdenken und Projekte zum eigenen Reifegrad wählen.
**Links**
Blogartikel zu Erfolgsfaktoren für Data-Science-Projekte
https://www.inwt-statistics.de/blog/erfolgsfaktoren-fuer-data-science-projekte
Folge #6: Statistik vs. Machine Learning
https://www.podbean.com/ew/pb-ewip2-128c6f8
Folge #83: Wie gut ist gut genug? Modellgütemaße richtig
verstehen https://www.podbean.com/eas/pb-8q2a8-19a0252
Folge #89: ROC around the clock – Alles rund um Gütemaße für
Klassifikationsmodelle
https://www.podbean.com/eas/pb-6jfj7-1a6a8ba
Folge #43: Damit es im Live-Betrieb nicht kracht: Vermeidung
von Overfitting & Data Leakage
https://www.podbean.com/ew/pb-vw736-15baac0
Folge #86: "Garbage In, Garbage Out" verhindern:
Datenvalidierung richtig gemacht
https://www.podbean.com/eas/pb-5kyzq-1a305ed
Folge #2: Erfolgsfaktoren für Predictive Analytics Projekte
https://www.podbean.com/ew/pb-kdcmd-12460ab
Folge #78: Der Use-Case-Guide: Navigationshilfe für echten
Mehrwert https://www.podbean.com/ew/pb-s5e2r-1928b4f
Folge #21: Machine Learning Operations (MLOps)
https://www.podbean.com/ew/pb-taen7-13ce0fa
Folge #23: Unsexy aber wichtig: Tests und Monitoring
https://www.podbean.com/ew/pb-vxp58-13f311a
Folge #24: Explainable AI: Entscheidungen von
Black-Box-Modellen verstehen
https://www.podbean.com/ew/pb-kn67b-1403089
Folge #47: Von Prognosen und Prompts: Data Science trifft
generative KI mit Tobias Sterbak
https://www.podbean.com/ew/pb-dkyex-1613842
Folge #70: Der Aufstieg zur Datenreife – Stufe für Stufe zur
Data Maturity https://www.podbean.com/ew/pb-a7663-1882b25
Folge #32: Brauche ich Data-Science-Berater*innen und wenn ja
wie viele? https://www.podbean.com/ew/pb-eaekc-14a6bbe
Folge #69: AI Agents verstehen und evaluieren mit Matthäus
Deutsch https://www.podbean.com/ew/pb-cq7xp-186d96d
Folge #80: Willkommen an Bord: Wie wir neue Kolleg*innen
begleiten https://www.podbean.com/ew/pb-232sr-1953fe6
Folge #51: Wer rastet, rostet: Die Rolle von Weiterbildung in
Data Science https://www.podbean.com/ew/pb-czpd3-16716c0
Folge #97: Die Güte von Gen-AI-Projekten bewerten mit Tobias
Sterbak https://www.podbean.com/eas/pb-7fhem-1b0096c
Fragen, Feedback oder Themenwünsche?
Schreibt uns gern an: podcast@inwt-statistics.de
Kommentare (0)
Melde dich an, um einen Kommentar zu schreiben.