Stahlrohre in einem Serverraum vereinen Datenströme als leuchtende Wasserfäden unter blauem Umgebungslicht.

Azure Data Factory (ADF) ist ein cloudbasierter ETL- und Datenintegrationsdienst von Microsoft Azure, der Datenpipelines erstellt, orchestriert und automatisiert. Er verbindet unterschiedliche Datenquellen, transformiert Rohdaten in verwertbare Formate und lädt sie in Zielsysteme wie Data Lakes oder Datenbanken. ADF ist damit ein zentrales Werkzeug für Unternehmen, die heterogene Datenlandschaften konsolidieren und eine belastbare Grundlage für Analytics und KI schaffen möchten. Die folgenden Abschnitte beantworten die wichtigsten Fragen rund um Funktionsweise, Einsatzszenarien und Integration von Azure Data Factory.

Wie funktioniert Azure Data Factory technisch?

Azure Data Factory funktioniert als serverloser Orchestrierungsdienst, der Datenpipelines aus grafisch konfigurierten Aktivitäten zusammensetzt. Eine Pipeline beschreibt den vollständigen Ablauf: Daten werden aus einer Quelle extrahiert, optional transformiert und in ein Zielsystem geladen. Die Ausführung erfolgt über sogenannte Integration Runtimes, die den eigentlichen Datentransport übernehmen.

Technisch basiert ADF auf drei Kernkonzepten:

  • Pipelines und Aktivitäten: Eine Pipeline ist eine logische Gruppierung von Aktivitäten, etwa Kopieraktivitäten, Datenflüsse oder externe Skriptaufrufe. Aktivitäten definieren, was mit den Daten passiert.
  • Linked Services und Datasets: Linked Services beschreiben die Verbindung zu einer Datenquelle oder einem Ziel, Datasets definieren die Struktur der Daten innerhalb dieser Verbindung.
  • Integration Runtime (IR): Die IR ist die Ausführungsumgebung. Azure bietet drei Varianten: eine Azure-basierte IR für Cloud-zu-Cloud-Szenarien, eine selbst gehostete IR für On-Premises-Verbindungen und eine Azure-SSIS-IR für die Migration klassischer SSIS-Pakete.

Trigger steuern, wann Pipelines starten, ob zeitbasiert, ereignisgesteuert oder manuell. Für komplexe Transformationen direkt im Datenstrom bietet ADF Mapping Data Flows, die visuell ohne Codeentwicklung konfigurierbar sind und intern auf Apache Spark laufen.

Welche Datenquellen unterstützt Azure Data Factory?

Azure Data Factory unterstützt über 90 native Konnektoren für Cloud-Dienste, On-Premises-Systeme, Datenbanken, SaaS-Anwendungen und Dateiformate. Dazu zählen relationale Datenbanken wie SQL Server, Oracle und PostgreSQL, Cloud-Speicher wie Azure Blob Storage und Amazon S3 sowie SaaS-Plattformen wie Salesforce, SAP und Dynamics 365.

Die Bandbreite der unterstützten Quellen lässt sich in vier Kategorien einteilen:

  • Relationale Datenbanken: SQL Server, Azure SQL Database, MySQL, PostgreSQL, Oracle, IBM Db2 und weitere
  • Cloud-Speicher und Data Lakes: Azure Data Lake Storage, Azure Blob Storage, Amazon S3, Google Cloud Storage
  • SaaS- und Geschäftsanwendungen: Salesforce, SAP ECC und SAP HANA, ServiceNow, Dynamics 365, Marketo
  • Dateiformate und Protokolle: JSON, Parquet, CSV, XML, ORC sowie HTTP- und FTP-Quellen

Für Quellen ohne nativen Konnektor lässt sich ADF über REST-APIs oder benutzerdefinierte Aktivitäten erweitern. Diese Breite macht ADF besonders wertvoll in gewachsenen Systemlandschaften, in denen Daten aus ERP-Systemen, Legacy-Datenbanken und modernen Cloud-Diensten zusammengeführt werden müssen. Im Kontext einer Azure Data Platform bildet ADF typischerweise die Integrationsschicht, die alle Datenquellen an ein zentrales Data Lakehouse anbindet.

Was ist der Unterschied zwischen Azure Data Factory und Azure Synapse Analytics?

Azure Data Factory ist ein spezialisierter Dienst für Datenintegration und Pipeline-Orchestrierung, während Azure Synapse Analytics eine umfassende Analyseplattform ist, die Datenintegration, Data Warehousing und Big-Data-Analyse unter einem Dach vereint. Synapse enthält eine integrierte ADF-ähnliche Pipeline-Funktion, geht aber deutlich darüber hinaus.

Was ADF besser kann

ADF ist die richtige Wahl, wenn der Fokus auf der reinen Datenintegration liegt: komplexe Pipeline-Orchestrierung, breite Konnektorunterstützung und die Migration von SSIS-Paketen. ADF lässt sich flexibel mit anderen Azure-Diensten kombinieren und eignet sich für Szenarien, in denen verschiedene Zielsysteme gleichzeitig bedient werden sollen.

Was Synapse Analytics zusätzlich bietet

Azure Synapse Analytics ergänzt die Pipeline-Funktionalität um einen dedizierten SQL-Pool für Data Warehousing, Apache Spark Pools für Big-Data-Verarbeitung, integrierte Notebooks für Data Science sowie eine einheitliche Arbeitsumgebung für Datentechnik und Analyse. Wer ein vollständiges, integriertes Analytics-Ökosystem aufbauen möchte, profitiert von Synapse. Für reine ETL- und Integrationsaufgaben reicht ADF oft aus und ist kostengünstiger. In der Praxis werden beide Dienste häufig kombiniert: ADF übernimmt die Datenintegration aus externen Quellen, Synapse die Verarbeitung und Analyse im Data Warehouse.

Wie skaliert Azure Data Factory bei großen Datenmengen?

Azure Data Factory skaliert automatisch und serverlos: Kapazität wird bei Bedarf bereitgestellt und nach der Ausführung wieder freigegeben. Du musst keine Infrastruktur provisionieren oder verwalten. Bei datenintensiven Transformationen über Mapping Data Flows nutzt ADF intern Apache Spark, dessen Cluster-Größe sich konfigurieren lässt.

Für die Skalierung bei großen Datenmengen sind folgende Mechanismen relevant:

  • Parallele Ausführung: Pipelines und Aktivitäten lassen sich parallel ausführen, um den Durchsatz zu maximieren.
  • Partitionierung: Kopieraktivitäten können Daten partitioniert lesen, etwa nach Datumsbereichen oder Schlüsselbereichen, um große Tabellen effizient zu verarbeiten.
  • Spark-Cluster-Konfiguration: Bei Mapping Data Flows lässt sich die Spark-Cluster-Größe anpassen, von kompakten Clustern für kleine Datenmengen bis zu leistungsstarken Konfigurationen für Milliarden von Datensätzen.
  • Inkrementelles Laden: Statt vollständige Datensätze zu kopieren, verarbeitet ADF nur geänderte Daten, was Laufzeiten und Kosten deutlich reduziert.

Die Kosten richten sich nach tatsächlichem Verbrauch: Aktivitätsläufe, Datenbewegungsvolumen und Spark-Kernstunden werden separat abgerechnet. Das macht ADF auch für Unternehmen attraktiv, die mit kleinen Datenmengen starten und später skalieren möchten.

Wann sollten Unternehmen Azure Data Factory einsetzen?

Azure Data Factory eignet sich für Unternehmen, die Daten aus mehreren heterogenen Quellen regelmäßig zusammenführen, transformieren und in Zielsysteme laden müssen. Besonders sinnvoll ist der Einsatz, wenn Datensilos aufgelöst, ein Data Lake aufgebaut oder eine Analytics-Plattform mit aktuellen Daten versorgt werden soll.

Typische Einsatzszenarien sind:

  • Aufbau eines Data Lakehouse: ADF lädt Rohdaten aus ERP, CRM und weiteren Systemen in Azure Data Lake Storage, wo sie für Analytics und KI aufbereitet werden.
  • Migration von On-Premises-Daten in die Cloud: Bestehende Datenbanken und SSIS-Pakete lassen sich schrittweise in Azure überführen.
  • Nightly Batch-Verarbeitung: Regelmäßige Datenaktualisierungen für Reporting und Dashboards werden automatisiert und zuverlässig ausgeführt.
  • Echtzeitnahe Datenintegration: Über ereignisgesteuerte Trigger verarbeitet ADF Daten kurz nach ihrem Entstehen, auch wenn keine echte Streaming-Verarbeitung benötigt wird.
  • Vorbereitung für KI und Machine Learning: Trainingsdaten für ML-Modelle werden automatisiert aufbereitet und in Azure Machine Learning oder Microsoft Fabric bereitgestellt.

ADF ist weniger geeignet, wenn Echtzeit-Streaming mit Latenzen unter einer Sekunde gefragt ist. Dafür bieten Azure Event Hubs oder Azure Stream Analytics die passendere Lösung. Für Unternehmen, die eine strukturierte Datenplattform aufbauen möchten, ist ADF jedoch fast immer ein unverzichtbarer Baustein.

Wie lässt sich Azure Data Factory in Microsoft 365 und Power Platform integrieren?

Azure Data Factory lässt sich über mehrere Wege mit Microsoft 365 und der Power Platform verbinden. Die engste Integration besteht mit Power BI: ADF stellt aufbereitete Daten in Azure Synapse Analytics oder Azure SQL Database bereit, auf die Power BI direkt zugreift. So entstehen aktuelle, automatisch befüllte Dashboards ohne manuelle Datenexporte.

Für die Power Platform im weiteren Sinne sind folgende Integrationspfade relevant:

  • Power BI Dataflows: ADF kann als vorgelagerte Integrationsschicht dienen, die Daten in ein Data Warehouse lädt, aus dem Power BI Dataflows ihre Daten beziehen.
  • Power Automate: Über HTTP-Trigger oder Azure Logic Apps lassen sich ADF-Pipelines aus Power Automate heraus starten, etwa wenn ein Formular eingereicht oder ein Datensatz in SharePoint geändert wird.
  • Microsoft Fabric: Die neuere Plattform Microsoft Fabric integriert ADF-ähnliche Pipelines nativ und verbindet sie eng mit OneLake, Power BI und Copilot-Funktionen. Bestehende ADF-Pipelines lassen sich in Fabric migrieren.
  • Microsoft 365-Daten als Quelle: Über den Microsoft-Graph-API-Konnektor kann ADF Daten aus Microsoft 365 extrahieren, etwa Aktivitätsdaten oder SharePoint-Inhalte, und sie in analytische Systeme überführen.

Diese Integrationsmöglichkeiten machen ADF zum Bindeglied zwischen operativen Systemen und den Analyse- und Automatisierungswerkzeugen des Microsoft-Ökosystems. Wer eine sichere Cloud-Basis benötigt, sollte außerdem sicherstellen, dass die zugrundeliegende Azure Landing Zone korrekt aufgesetzt ist, da ADF auf Governance, Netzwerksegmentierung und Zugriffssteuerung angewiesen ist, um sicher und compliant betrieben zu werden.

Wie Communardo Smart Work beim Einstieg in Azure Data Factory unterstützt

Communardo Smart Work begleitet Unternehmen von der ersten Orientierung bis zum produktiven Betrieb einer modernen Datenintegrationslösung auf Basis von Azure Data Factory. Der Ansatz ist modular und orientiert sich am tatsächlichen Reifegrad der bestehenden Datenlandschaft.

Das Leistungsangebot umfasst konkret:

  • Azure Data Platform Discovery: Analyse der bestehenden Datenquellen, Systemlandschaft und Integrationslücken als Ausgangspunkt für die Architekturplanung
  • Zielarchitektur-Workshop: Entwicklung einer konkreten technischen Zielarchitektur mit ADF als Integrationsschicht, abgestimmt auf Analytics-, Reporting- und KI-Anforderungen
  • MVP-Implementierung: Ein erster produktiver Datenpipeline-Baustein lässt sich in der Regel innerhalb von 6 bis 10 Wochen realisieren, etwa die Anbindung priorisierter Quellsysteme an ein Data Lakehouse
  • Power BI und Analytics Enablement: Aufbau von Dashboards und Self-Service-Analytics auf Basis der durch ADF bereitgestellten Daten
  • Betrieb und Governance: Einrichtung von Monitoring, Alerting, Backup-Konzepten und Sicherheitsüberwachung für den laufenden Betrieb

Der modulare Ansatz ermöglicht es, mit einer sicheren Basis zu starten und die Plattform schrittweise um weitere Datenquellen, KI-Anwendungen oder neue Fachbereiche zu erweitern. Wenn du wissen möchtest, wie eine solche Lösung für dein Unternehmen aussehen könnte, nimm gerne Kontakt auf und lass uns gemeinsam die nächsten Schritte besprechen.

Das könnte dich auch interessieren