Daten
Der Weg der Daten, bevor irgendeine Methode auf sie angewendet wird. Zuerst das Einlesen mit seinen Formaten und Kodierungsfallen, dann die Frage, welche Form Daten haben sollen, dann das Umformen selbst. Datenqualität steht bewusst vor der Statistik: Kennzahlen aus Daten mit stillen Duplikaten oder falsch behandelten fehlenden Werten sind präzise und falsch.
Daten, die nicht als Datei kommen, sondern aus einem laufenden System, behandelt der eigene Bereich Datenbanken: Modellierung, SQL, der Zugriff aus R und Python sowie die gängigen Systeme.
Datenimport und Formate
CSV, Excel, JSON und Pickle lesen und schreiben, Kodierung beachten.
Tidy Data
Eine Zeile je Beobachtung, eine Spalte je Variable, und warum das trägt.
Data Wrangling
Filtern, sortieren, gruppieren, umformen und verbinden in beiden Sprachen.
Datum und Zeit
Datumsangaben einlesen, Bestandteile herausziehen, rechnen, Zeitzonen.
Textdaten und reguläre Ausdrücke
Text zerlegen, bereinigen und vereinheitlichen mit regulären Ausdrücken, und die Fallen bei Punkt, Gier und Umlauten.
Datenqualität
Plausibilität, fehlende Werte, Duplikate und uneinheitliche Kategorien.
APIs und Web-Scraping
Daten aus Schnittstellen und Webseiten holen: JSON seitenweise abrufen, HTML auslesen, Fehler abfangen und fair bleiben.
Grosse Datenmengen
Wenn CSV und Arbeitsspeicher an Grenzen kommen: Parquet, nur benötigte Spalten lesen und verzögerte Auswertung mit Arrow und Polars.
Fragen zu Daten
Übergreifende Fragen zu Import, Wrangling, Datenqualität und SQL.
Die Fragen zu diesem Bereich prüfen die Verbindungen zwischen den Themen.