Contexte & enjeu
Collecter des informations provenant notamment d’un CRM et de contenus non structurés.
Le processus devait réunir collecte automatisée, transformation des contenus et comparaison sémantique dans une architecture évolutive.
Objectifs
- Automatiser la collecte de données.
- Structurer les informations récupérées.
- Transformer les contenus non structurés vers JSON.
- Comparer sémantiquement les données collectées.
Sources & données
- Données CRM
- Contenus non structurés
- Données collectées sur le web
- Données structurées en JSON
Intervention
Automatisation de la collecte avec Python, Playwright et Web Scraping, transformation des contenus en données JSON et mise en place d’un mécanisme de comparaison sémantique avec un LLM.
- Automatisation de la collecte avec Python et Playwright.
- Structuration des données issues de sources hétérogènes.
- Transformation des contenus vers JSON.
- Conception d’un système de comparaison sémantique basé sur un LLM.
Résultat
Une chaîne automatisée permettant de collecter, structurer et homogénéiser des informations issues de sources hétérogènes avant leur exploitation et leur comparaison.
Collecte automatisée
Automatisation de la récupération des informations avec Python et Playwright.
Données structurées
Transformation des contenus hétérogènes vers un format JSON exploitable.
Comparaison sémantique
Mise en place d’un mécanisme permettant de rapprocher les contenus collectés.
Technologies
- Python
- Playwright
- Web Scraping
- LLaMA
- JSON
- GitLab
Besoin similaire ?
Vous avez un sujet Data ou BI à fiabiliser ?
Échangeons sur vos données, vos traitements et le résultat attendu pour définir une intervention adaptée à votre contexte.