Skip to content
pipelines: ok

§01 — Product

Die Validierungsschicht, der Ihre Produktions-ML-Pipelines vertrauen.

Datenklo ersetzt vier bis sechs selbstgebaute Great-Expectations- und dbt-Checks durch eine Pipeline, die Schema-Drift, Null-Werte, Duplikate und stille Label-Korruption in einem Durchlauf erkennt — bevor sie Ihr Modell vergiften. Wochenend-Feuerwehr wird zum Drei-Minuten-Morgenreport.

  • ISO 27001:2022
  • SOC 2 Type II
  • BaFin-reviewed
  • Berlin-Mitte, DE
~/dwh/prod $ datenklo validate orders_eu_de --report
CHECKRESULTDETAIL
schema_drift PASS 47/47 columns
null_profile PASS max 0.4% · order_total_eur
duplicate_keys PASS 0 on (order_id)
label_corruption FAIL 3.2% churn_label flipped
row_count DELTA −12.4% vs 7d median
8.7T rows processed · last 12 mo 04:12 CET

§02 — Validation Engine

Vier Checks. Eine Pipeline. Keine Sonntag-Schicht mehr.

Die Validation Engine ersetzt Ihren Flickwerk-Stack aus Great Expectations, dbt-Tests und Ad-hoc-Airflow-Skripten durch eine deterministische Pipeline, die jeder Data Engineer lesen, debuggen und erweitern kann — ohne Tickets ans Platform-Team.

  1. 01

    Schema-Drift-Erkennung

    Vergleicht das eingehende Schema gegen einen versionierten Vertrag — neue Spalten, umbenannte Felder, Typ-Wechsel (INT64 → STRING) und verdächtige Nullable-Änderungen werden markiert, bevor ein Downstream-Job auf NULL multipliziert.

    • JSON-Schema-Verträge
    • Breaking-Change-Klassifizierung
    • PR-kommentierbar
  2. 02

    Null-Profiling & Range-Checks

    Erfasst NULL-Quoten pro Spalte und vergleicht sie mit einem 7- und 30-Tage-Median. Ergänzend akzeptieren Sie deklarative Range-, Regex- und Enums-Bedingungen pro Feld — alles versioniert in Git, nicht im UI versteckt.

    • Adaptive Schwellen
    • Range · Regex · Enum
    • P95-Warnungen
  3. 03

    Duplicate-Detection

    Erkennt exakte und fuzzy duplikate Schlüssel über zusammengesetzte Composite Keys (z. B. (order_id, line_item)). Nutzt Bloom-Filter für PetaByte-Tabellen, sodass die Prüfung Minuten statt Stunden dauert.

    • Composite Keys
    • Bloom-Filter
    • Soft- vs Hard-Dedupe
  4. 04

    Silent Label Corruption

    Unser Flagship-Check. Erkennt Label-Flips, Klassen-Drift und Target-Leakage durch statistische Vergleichsmodelle — er hat im Q4 2025 drei Kunden vor einem €2,1M-Modell-Rollback bewahrt, weil ein ETL-Schritt still die Spalte churn_label invertiert hatte.

    • Klassen-Verteilungs-Drift
    • Target-Leakage-Wächter
    • Auto-Quarantäne

§03 — Lineage Echo

Spulen Sie eine korrupte Zeile 90 Tage zurück — bis zur eigentlichen Quelle.

Wenn ein ML-Modell ein falsches Label bekommt, will niemand den Schuldigen im 14. dbt-Modell suchen. Lineage Echo nimmt die betroffene Zeile, denkt sie rückwärts durch jede Transformation der letzten 90 Tage und meldet: diese Spalte, in dieser Quelle, an diesem Zeitpunkt, durch diesen Run. Patentiert. Von keinem Wettbewerber repliziert.

  • Bidirektionale Replay-Engine — vorwärts und rückwärts durch DBT-, Airflow- und Spark-Graphen.
  • Row-Level Fingerprinting — Hash + Inhalt, damit ein Replay auch nach Joins noch die Original-Zeile findet.
  • PDF-Audit-Export — direkt an BaFin, Aufsichtsrat oder den Head of Data, ohne Screenshots.
Diagnose my dataset
REPLAY · row_id = ord_8821_churn
ml.training_set churn_label = 1 (WRONG)
mart.orders_labeled dbt run · 2025-11-04 03:11
stg.crm_events CASE WHEN flipped ❌
raw.crm.events.json source of truth · OK
Echo Depth: 17 transforms Window: 90 days TRUE SOURCE FOUND

§04 — Connectors

Direkt angeschlossen an den DACH-Datenstack, für den Sie gebaut haben.

Wir gehören zu den wenigen DACH-gehosteten Plattformen mit nativen Konnektoren für SAP S/4HANA, Snowflake EU-West und BigQuery Frankfurt — damit Ihre Daten die EU nie verlassen.

Source

SAP S/4HANA

IDoc-, OData- und CDS-View-Extrakt mit Delta-Sync auf Stundengranularität. Inkl. Mapping-Templates für FI/CO und MM.

  • IDoc · OData · CDS
  • EU-resident
Warehouse

Snowflake EU-West

Native Streams + Tasks-Integration. Validierung läuft In-Account, ohne dass Daten die Region verlassen.

  • Streams · Tasks
  • In-Account Engine
Warehouse

BigQuery Frankfurt

Information-Schema-Snapshots plus Remote-Functions für PII-Erkennung. Vollständig IAM- und VPC-konform.

  • Information Schema
  • Remote Functions
Orchestration

dbt & Airflow

Native Sensoren für dbt-Cloud- und Airflow-Runs. Validierungs-Ergebnisse fließen zurück als Test-Resultate in CI/CD.

  • dbt tests
  • Airflow sensor

+ 38 weitere Konnektoren: Databricks, Redshift, Postgres, Kafka, S3, Azure Blob, MSSQL, Oracle, MongoDB, InfluxDB, Kinesis, Pub/Sub, plus jede REST- oder JDBC-Quelle.

§05 — Governance Pack

Compliance ist eingebaut, nicht aufgeklebt.

Jede Datenklo-Bereitstellung enthält das Governance Pack — das GDPR-Artikel-25-Vorpaket, die Audit-Trail-Pipeline und das Aufbewahrungsregelwerk, das bereits 12 BaFin-Prüfungen im Jahr 2024 bestanden hat.

A

GDPR Art. 25 — Pre-Assessment Pack

Datenschutz-Folgenabschätzung, Auftragsverarbeitungsvertrag und technisch-organisatorische Maßnahmen — vorausgefüllt für Ihren Use Case. BaFin-Review-konform.

B

Immutable Audit Trail

Jede Validierungsentscheidung wird kryptografisch signiert und 7 Jahre aufbewahrt — exportierbar als JSON, Parquet oder signiertes PDF für Aufsichtsbehörden.

C

Data Lineage & Purpose Binding

Verknüpft jede Spalte mit ihrem Verarbeitungszweck. Wenn sich der Zweck ändert, blockiert der Check den Downstream-Konsum — kein Modell darf Daten zweckfremd nutzen.

D

Retention & Right-to-Erasure

Deklarative Aufbewahrungsfristen pro Dataset plus automatisierter Lösch-Workflow für Betroffenenrechte. Vollständig auditierbar, mit Bestätigungs-Hash pro Vorgang.

§06 — By the numbers

Was Datenklo 2025 gemessen hat.

11 wk → 38 h
Median Build-Time für eine Validierungs-Pipeline
8.7T
Zeilen durch die Validation Engine (letzte 12 Mo.)
412
Zahlende Kunden in 19 Ländern
6.8×
Kunden-ROI binnen 9 Monaten (VDC Research, n=87)