Daten

Von der Rohdatei über Tidy Data und Wrangling bis zur Datenqualität.

Der Weg der Daten, bevor irgendeine Methode auf sie angewendet wird. Zuerst das Einlesen mit seinen Formaten und Kodierungsfallen, dann die Frage, welche Form Daten haben sollen, dann das Umformen selbst. Datenqualität steht bewusst vor der Statistik: Kennzahlen aus Daten mit stillen Duplikaten oder falsch behandelten fehlenden Werten sind präzise und falsch.

Daten, die nicht als Datei kommen, sondern aus einem laufenden System, behandelt der eigene Bereich Datenbanken: Modellierung, SQL, der Zugriff aus R und Python sowie die gängigen Systeme.

Datenimport und Formate

CSV, Excel, JSON und Pickle lesen und schreiben, Kodierung beachten.

Tidy Data

Eine Zeile je Beobachtung, eine Spalte je Variable, und warum das trägt.

Data Wrangling

Filtern, sortieren, gruppieren, umformen und verbinden in beiden Sprachen.

Datum und Zeit

Datumsangaben einlesen, Bestandteile herausziehen, rechnen, Zeitzonen.

Textdaten und reguläre Ausdrücke

Text zerlegen, bereinigen und vereinheitlichen mit regulären Ausdrücken, und die Fallen bei Punkt, Gier und Umlauten.

Datenqualität

Plausibilität, fehlende Werte, Duplikate und uneinheitliche Kategorien.

APIs und Web-Scraping

Daten aus Schnittstellen und Webseiten holen: JSON seitenweise abrufen, HTML auslesen, Fehler abfangen und fair bleiben.

Grosse Datenmengen

Wenn CSV und Arbeitsspeicher an Grenzen kommen: Parquet, nur benötigte Spalten lesen und verzögerte Auswertung mit Arrow und Polars.

Fragen zu Daten

Übergreifende Fragen zu Import, Wrangling, Datenqualität und SQL.

Keine Treffer

Die Fragen zu diesem Bereich prüfen die Verbindungen zwischen den Themen.