Contexte & enjeu
Migration et préparation de données dans un environnement Cloudera / Teradata.
L’intégration nécessitait des traitements analytiques fiables ainsi que des contrôles de qualité, de cohérence et d’anomalies.
Objectifs
- Migrer et intégrer les données vers Cloudera et Teradata.
- Préparer et croiser les données multi-sources.
- Renforcer les contrôles de Data Quality.
- Optimiser les traitements analytiques.
Sources & données
Sources
- Données multi-sources
- Données métier
Environnement cible
- Données intégrées dans Teradata
Contrôles
- Résultats de contrôles et anomalies
Intervention
Développement et optimisation de la chaîne de préparation et d’intégration des données avec Python, PySpark et SQL.
- Préparation et intégration des données dans l’environnement cible.
- Croisement et consolidation des différentes sources.
- Mise en œuvre de contrôles de cohérence.
- Définition de règles de détection d’anomalies.
- Optimisation des traitements analytiques.
Résultat
Un socle de données consolidé et contrôlé dans l’environnement cible, avec des traitements reproductibles et des règles permettant d’identifier les anomalies avant exploitation métier.
Données consolidées
Croisement des différentes sources avant exploitation.
Contrôles intégrés
Identification des incohérences et anomalies.
Traitements reproductibles
Préparation et intégration structurées dans l’environnement cible.
Technologies
- Python
- PySpark
- SQL
- Cloudera
- Teradata
- Jenkins
- GitLab
Besoin similaire ?
Vous avez un sujet Data ou BI à fiabiliser ?
Échangeons sur vos données, vos traitements et le résultat attendu pour définir une intervention adaptée à votre contexte.