Publiziert:

Data Architecture: Medallion und Data Mesh

Struktur macht aus Rohdaten belastbare Datenprodukte

In einer datengetriebenen Wirtschaft entscheidet die Architektur der Daten-Pipelines, wie schnell belastbare Erkenntnisse entstehen. Strukturierte Konzepte wie die Medallion Architecture (Bronze, Silver, Gold) und dezentrale Ansätze wie Data Mesh geben Rohdaten eine prüfbare Form.

Ziel ist es, Daten von unstrukturierten Rohdaten in hochqualitative, geschäftskritische Informationsprodukte zu transformieren, die sowohl für klassische Analysen als auch für Generative KI (RAG) nutzbar sind.

Anti-Patterns: Der Data Swamp

Ohne klare Architektur enden Daten-Initiativen oft in einem Data Swamp: Unmengen an unstrukturierten, teilweise fehlerhaften Daten liegen in einem Data Lake, ohne dass klar ist, welche Version die korrekte ist. Dies führt zu falschen Analyse-Ergebnissen, hohen Speicherkosten und verhindert die effektive Nutzung von KI, da das Modell auf schlechten Daten (Garbage in, Garbage out) basiert.

Strukturierte Datenveredelung

  1. Medallion Architecture:
    • Bronze (Raw): Speicherung der Rohdaten 1:1, wie sie aus dem Quellsystem kommen. Historisierung ist hier entscheidend.
    • Silver (Validated): Bereinigte, gefilterte und standardisierte Daten. Die Basis für teamübergreifende Analysen.
    • Gold (Enriched): Kuratierte, geschäftsfertige und für spezifische Geschäftsfragen optimierte Daten (Data Products), oft aggregiert.
  2. Data Mesh Prinzipien: Datenverantwortung liegt dort, wo die Daten entstehen (Domain Ownership). Daten werden als Produkt (Data as a Product) über standardisierte Schnittstellen angeboten.
  3. Data Lakehouse: Kombination der Flexibilität eines Data Lakes mit der Struktur und Performance eines Data Warehouses.
  4. Schema Enforcement: Technische Erzwingung von Datenstrukturen in frühen Phasen, um die strukturelle Qualität im Silver- und Gold-Layer abzusichern und Schema-Drift früh zu erkennen (semantische Korrektheit und Aktualität sichert sie nicht allein).
  5. KI-Ready Layers: Dedizierte Bereitstellung von Vektordaten (Embeddings) für RAG-Anwendungen auf Basis der Gold-Daten.

Der Vorteil: Single Source of Truth

Durch die strukturierte Veredelung weiss jeder Nutzer (Mensch oder KI) genau, welchem Datenlayer er vertrauen kann und welche Qualität er dort erwarten darf.

FAQ

Ist Data Mesh nicht zu komplex für ein mittelständisches Unternehmen?

Man muss nicht alle Prinzipien gleichzeitig einführen. Die wichtigste Erkenntnis aus Data Mesh für KMUs ist die Domain Ownership: Die Fachabteilung muss für die Qualität ihrer Daten verantwortlich sein, nicht die IT.

Warum werden Rohdaten (Bronze) separat gespeichert, wenn sie ohnehin bereinigt werden?

Um jederzeit in die Vergangenheit schauen zu können. Wenn sich die Bereinigungslogik ändert, lässt sich der Silver-Layer vollständig aus den unveränderten Bronze-Daten neu aufbauen.

Referenzen