AWS, Datenanalyse-Pipeline, Cloud-Sicherheit, Kostenoptimierung

Einrichtung einer sicheren Datenanalyse-Pipeline

Wichtige Herausforderungen

Unosecur musste CloudTrail-Protokolle in Echtzeit ohne Duplizierung verarbeiten, große Datenmengen bewältigen und Kosteneffizienz gewährleisten, während Daten für Erkenntnisse transformiert wurden. Darüber hinaus waren die Gewährleistung von Datenintegrität, Verschlüsselung, Zugriffskontrolle und Überwachung zentrale Anliegen. Echtzeit-Updates alle 4 Stunden und Kostenoptimierung waren kritische Anforderungen.

Wichtige Ergebnisse

Die AWS EMR-basierte Pipeline verarbeitete Daten effizient und erfüllte die Anforderung an 4-stündige Updates. Spot-Instanzen reduzierten die Kosten, während AWS Glue ein nahtloses Schema-Management gewährleistete. Redshift-Dashboards lieferten Echtzeit-Einblicke, und CloudWatch-Alarme sorgten für minimale Ausfallzeiten. Sicherheitsmaßnahmen wie End-to-End-Verschlüsselung, Datenmaskierung, automatisierte Sicherheitsscans und Audit-Protokollierung verbesserten die Compliance und den gesamten Datenschutz, wodurch die Lösung sicherheitskonform wurde.

Übersicht

Unosecurs Mission ist es, die Cloud-Sicherheit zu vereinfachen, indem Herausforderungen im Zusammenhang mit der Verwaltung übermäßiger Berechtigungen und Identitätsrisiken in Cloud-Umgebungen angegangen werden. Um Unternehmen umsetzbare Einblicke zu ermöglichen, benötigte Unosecur eine Lösung zur Verarbeitung und Analyse großer Mengen von Protokolldaten unter Einhaltung von Sicherheits- und Compliance-Standards.

Die Daten, hauptsächlich in Form von AWS CloudTrail-Protokollen, wurden kontinuierlich generiert und in einem S3-Bucket gespeichert. Ziel war es, eine automatisierte, skalierbare und sichere Pipeline aufzubauen, um diese Protokolle zu verarbeiten, die Daten zu transformieren und sie für die Analyse und Visualisierung auf einem alle 4 Stunden aktualisierten Dashboard zugänglich zu machen.

Herausforderungen

Kontinuierliche Datenerfassung & -integrität:

CloudTrail-Protokolle wurden in Echtzeit generiert und in S3 gespeichert, was ein System erforderte, das inkrementelle Daten ohne Duplizierung verarbeiten und gleichzeitig die Datenintegrität wahren konnte. Es war entscheidend sicherzustellen, dass die Protokolle nicht manipuliert oder verändert wurden. Das Fehlen von Verschlüsselung und Zugriffskontrollen könnte sensible Protokolle unbefugtem Zugriff oder Änderungen aussetzen. [SEG 6] Datenzugriff, Transformation & Maskierung:

Rollenbasierte Authentifizierung wurde für die Aktualisierung von AWS-Diensten über die Pipeline verwendet. Die Protokolldaten mussten gefiltert, transformiert und strukturiert werden, bevor sie in ein Data Warehouse geladen wurden. CloudTrail-Protokolle enthielten jedoch oft sensible Informationen wie IAM-Benutzer, IP-Adressen, Kontodaten und andere Metadaten, die Sicherheitsrisiken darstellen könnten. Ohne ordnungsgemäße Maskierung und Verschlüsselung könnten personenbezogene Daten (PII) während der Verarbeitung und Speicherung offengelegt werden.

Kostenoptimierung & sichere Speicherung:

Die Lösung musste die Infrastrukturkosten minimieren und gleichzeitig die Leistung aufrechterhalten. Es musste jedoch sichergestellt werden, dass kostengünstige Speicherlösungen dennoch strenge Verschlüsselungsrichtlinien und Compliance-Standards einhielten. Die Speicherung sensibler Daten musste verschlüsselt und vor dem Löschen geschützt werden.

Echtzeit-Updates & sichere Audit-Protokollierung:

Erkenntnisse aus den Daten mussten innerhalb von 4-Stunden-Intervallen verfügbar sein, was häufige Datenverarbeitungszyklen erforderte. Obwohl Echtzeit-Monitoring vorhanden war, mussten Protokolle geprüft und alle Änderungen nachverfolgt werden.

„Die Lösung nutzte Amazon EMR und AWS Glue Data Catalog, Glue-Jobs für eine skalierbare, kostengünstige Datenanalyse-Pipeline“

Architektur:

Datenerfassung und -verarbeitung:

Lösung

Ein Glue-Job und eine Spark-Anwendung wurden entwickelt, um die CloudTrail-Protokolle und Echtzeitdaten von der auf einer EC2-Instanz bereitgestellten Anwendung zu verarbeiten, um Informationen zum AWS-Konto abzurufen und in einem S3-Bucket zu speichern. Die Spark-Anwendung führte Transformationen wie das Filtern von Protokollen, die Umstrukturierung von Daten und das Extrahieren relevanter Felder durch. S3-Serverseitige Verschlüsselung (SSE-KMS) und Object Lock wurden aktiviert, um die Datenintegrität und Datenverfügbarkeit zu gewährleisten.

Persistente EMR-Cluster:

Ein EMR-Cluster wurde im persistenten Modus bereitgestellt. Der Cluster führte die Spark-Streaming-Anwendung aus, die die Daten in Echtzeit von S3 las, die Operation durchführte und in eine andere S3-Schicht schrieb.

Instanzkonfiguration: 

Der EMR-Cluster nutzte speicheroptimierte EC2-Instanzen für eine effiziente Verarbeitung:

1 Master-Knoten: r5.xlarge

2 Core-Knoten: r5.xlarge

2 Task-Knoten: r5.2xlarge (als Spot-Instanzen konfiguriert, mit Fallback auf On-Demand-Instanzen bei Bedarf).

Metadatenmanagement:

Der AWS Glue Data Catalog wurde verwendet, um unstrukturierte Daten aus CloudTrail-Protokollen zu verwalten. Glue-Crawler wurden so konfiguriert, dass sie Schemata dynamisch aktualisieren, wenn neue Felder eingeführt wurden.

Batch-Job-Konfiguration:

Wir nutzten Glue, um die Daten täglich aus MongoDB zu lesen, die für die Analysen erforderlichen Metriken zu berechnen und sie in den S3-Bucket zu schreiben. 

Inkrementelles Laden von Daten:

Checkpointing wurde mit Spark implementiert, um sicherzustellen, dass in jedem Zyklus nur neue Protokolle verarbeitet wurden. Die verarbeiteten Daten wurden in ein Redshift-Data-Warehouse geladen.

Datenvisualisierung & sicherer Zugriff:

Redshift-gestützte Dashboards ermöglichten MFA-authentifizierten Benutzern den Zugriff auf Erkenntnisse in nahezu Echtzeit. Das Data Warehouse ermöglichte effiziente Abfragen für Analysen und wurde dabei von KMS verschlüsselt.

Monitoring und Alarmierung:

CloudWatch-Alarme wurden eingerichtet, um den EMR-Cluster zu überwachen und das Team über Probleme zu informieren. AWS Inspector wurde für das Schwachstellenmanagement von Instanzen eingesetzt. AWS Config wurde verwendet, um Konfigurationsänderungen zu erkennen und zu melden. AWS Inspector wurde für die kontinuierliche Schwachstellensuche auf EC2-Instanzen integriert.

Geschäftsergebnis

Effiziente Datenverarbeitung:

Die Spark-Anwendung auf EMR ermöglichte die hochperformante Transformation von CloudTrail-Protokollen, wobei sichergestellt wurde, dass die Daten innerhalb der erforderlichen 4-Stunden-Intervalle verarbeitet wurden, unter Beibehaltung von Verschlüsselung und Integrität.

Kostenoptimierung:

Transiente EMR-Cluster und die Nutzung von Spot-Instanzen für Task-Knoten reduzierten die Betriebskosten erheblich. On-Demand-Instanzen dienten als zuverlässiger Fallback, wenn Spot-Kapazität nicht verfügbar war, wodurch Leistung und Kosten ausgeglichen wurden.

Verbessertes und sicheres Datenmanagement:

Der AWS Glue Data Catalog optimierte das Schema-Management, indem er sich an Änderungen in der Protokolldatenstruktur anpasste, ohne manuelles Eingreifen zu erfordern. Die Metadaten wurden konsistent aktualisiert und sensible Daten wurden vor der Aufnahme in Redshift maskiert, wodurch Compliance-Standards gewährleistet wurden.

Echtzeit-Erkenntnisse:

Redshift-gestützte Dashboards lieferten den Stakeholdern umsetzbare Erkenntnisse und ermöglichten zeitnahe Entscheidungen. Das effiziente Design der Pipeline gewährleistete minimale Verzögerungen zwischen der Protokollgenerierung und der Datenverfügbarkeit, während Authentifizierungs- und Zugriffskontrollen durchgesetzt wurden.

Verbesserte Überwachung:

CloudWatch-Alarme, CloudTrail-Protokolle, Config und AWS Inspector-Scans stellten sicher, dass alle Sicherheitsprobleme mit dem EMR-Cluster oder der Datenpipeline umgehend erkannt und behoben wurden. Die Überwachungseinrichtung minimierte Ausfallzeiten und gewährleistete die Betriebszuverlässigkeit.

Skalierbare und zukunftssichere Architektur:

Die EMR-basierte Lösung wurde entwickelt, um wachsende Datenmengen problemlos zu verarbeiten und so langfristige Skalierbarkeit und Zuverlässigkeit für die sich entwickelnden Anforderungen von Unosecur zu gewährleisten.

Diesen Beitrag teilen

Verwandte Fallstudien

Von manuell zu automatisiert: Bereitstellung transformieren und Sicherheit verbessern

AWS, Cloud Security, AWS WAF, CI/CD Pipelines
Fallstudie lesen

Entwicklung einer Cloud Identity Security SaaS-Plattform

SaaS, AWS, Cloud
Fallstudie lesen

Das Ankercloud-Team hört Ihnen gerne zu