Contexte
Au sein d’une Data Factory, j’interviens sur le traitement, l’intégration et la migration de données entre Cloudera et Teradata.
- Données métier issues de plusieurs sources
- Traitements PySpark sur Cloudera
- Données destinées à Teradata
Problème et enjeu
Les traitements existants doivent être adaptés à l’environnement cible tout en traduisant les règles métier et en réunissant plusieurs sources.
Objectifs
- Faire évoluer les traitements PySpark sur Cloudera.
- Adapter les traitements vers Teradata avec SQL et Shell.
- Intégrer et rapprocher les données multi-sources.
Intervention
Je développe et adapte les traitements d’intégration. En Python, j’ai également réalisé un traitement de pseudonymisation et de rapprochement des données.
- Évolution de traitements PySpark et traduction des règles métier.
- Migration et adaptation des traitements vers Teradata avec SQL et Shell.
- Pseudonymisation et rapprochement de données avec Python.
Résultat
Des traitements adaptés à Teradata et des données préparées, intégrées et rapprochées pour les besoins métier. La mission est en cours.
Technologies
- Python
- PySpark
- SQL
- Shell
- Cloudera
- Teradata
- Jenkins
- GitLab
Besoin similaire ?
Vous avez un besoin similaire ? Parlons-en.
Échangeons sur vos données, vos traitements et le résultat attendu pour définir une intervention adaptée à votre contexte.