Contexte
Au sein d’un Pôle Innovation, j’ai développé des prototypes de collecte et de structuration de données issues de plateformes de marchés publics et d’un CRM.
- Données CRM
- Contenus non structurés
- Données collectées sur le web
- Données structurées en JSON
Problème et enjeu
Le processus devait réunir collecte automatisée, transformation des contenus et comparaison sémantique dans une architecture évolutive.
Objectifs
- Automatiser la collecte de données.
- Structurer les informations récupérées.
- Transformer les contenus non structurés vers JSON.
- Comparer sémantiquement les données collectées.
Intervention
J’ai automatisé la récupération de documents avec Python et Playwright, structuré des contenus en JSON et développé un système de comparaison sémantique utilisant des modèles LLM.
- Automatisation de la collecte avec Python et Playwright.
- Structuration des données issues de sources hétérogènes.
- Transformation des contenus vers JSON.
- Conception d’un système de comparaison sémantique basé sur un LLM.
Résultat
Des prototypes qui automatisent la collecte, structurent les contenus en JSON et permettent leur comparaison sémantique, dans une architecture modulaire.
Technologies
- Python
- Playwright
- LLaMA
- JSON
- GitLab
Besoin similaire ?
Vous avez un besoin similaire ? Parlons-en.
Échangeons sur vos données, vos traitements et le résultat attendu pour définir une intervention adaptée à votre contexte.