Toutes les réalisations

Migration et intégration de données multi-sources

Adapter des traitements de Cloudera vers Teradata et rapprocher des données multi-sources.

Expérience professionnelleDonnées décisionnelles

Mission réalisée dans le cadre de mon parcours professionnel. Aucune donnée interne ou confidentielle n’est divulguée.

Illustration abstraite du flux principal — aucune donnée interne ou confidentielle n’est représentée.

Contexte

Au sein d’une Data Factory, j’interviens sur le traitement, l’intégration et la migration de données entre Cloudera et Teradata.

  • Données métier issues de plusieurs sources
  • Traitements PySpark sur Cloudera
  • Données destinées à Teradata

Problème et enjeu

Les traitements existants doivent être adaptés à l’environnement cible tout en traduisant les règles métier et en réunissant plusieurs sources.

Objectifs

  • Faire évoluer les traitements PySpark sur Cloudera.
  • Adapter les traitements vers Teradata avec SQL et Shell.
  • Intégrer et rapprocher les données multi-sources.

Intervention

Je développe et adapte les traitements d’intégration. En Python, j’ai également réalisé un traitement de pseudonymisation et de rapprochement des données.

  • Évolution de traitements PySpark et traduction des règles métier.
  • Migration et adaptation des traitements vers Teradata avec SQL et Shell.
  • Pseudonymisation et rapprochement de données avec Python.

Résultat

Des traitements adaptés à Teradata et des données préparées, intégrées et rapprochées pour les besoins métier. La mission est en cours.

Technologies

  • Python
  • PySpark
  • SQL
  • Shell
  • Cloudera
  • Teradata
  • Jenkins
  • GitLab

Besoin similaire ?

Vous avez un besoin similaire ? Parlons-en.

Échangeons sur vos données, vos traitements et le résultat attendu pour définir une intervention adaptée à votre contexte.

Discuter de votre projet