Méthodologie des données
Dernière mise à jour : juillet 2026
VapaLape est une plateforme indépendante qui collecte, normalise et organise en continu les données produits du marché français de la vape. Nous ne dépendons ni de flux affiliés ni de soumissions de revendeurs — notre jeu de données est construit en observant le marché public, en appliquant des techniques de normalisation et en validant les résultats.
Cette page explique comment nos données sont collectées, traitées et structurées.
Couverture du marché
VapaLape surveille plus de 108 boutiques de vape en ligne en France. Notre couverture couvre l'ensemble des catégories : e-cigarettes, e-liquides, équipement DIY, résistances et pods, CBD et accessoires.
De nouveaux revendeurs et produits sont ajoutés au fur et à mesure qu'ils apparaissent. Notre couverture est revue régulièrement pour refléter le paysage réel du marché.
Collecte des données
VapaLape utilise Scrapy, un framework open-source de web scraping, pour collecter les informations produits depuis les sites des revendeurs. Chaque revendeur est collecté selon un calendrier régulier, dont la fréquence dépend de la mise à jour de son catalogue et de ses prix.
Nous collectons les noms de produits, descriptions, images, prix, statuts de stock, marques et catégories. Seules les informations publiquement disponibles sont collectées — aucune authentification ni accès à des zones restreintes n'est requis.
Normalisation
Les revendeurs décrivent un même produit différemment. Un magasin peut lister « ELIQUIDE FRUITY 50ML 3MG » tandis qu'un autre vend « E-Liquide Fruité 50ml 3 mg ». La normalisation mappe ces variations vers un format cohérent.
- La normalisation inclut :
- La conversion des unités et quantités vers des formats standardisés (ml, mg, %)
- Le nettoyage des noms de marques et produits
- Le mappage des profils aromatiques et taux de nicotine vers des valeurs canoniques
- La détection et la correction d'erreurs typographiques
Sans normalisation, la comparaison de prix entre revendeurs serait peu fiable. C'est cette étape qui rend la comparaison pertinente.
Rapprochement des produits
Le rapprochement des produits est le défi technique principal. Étant donné deux fiches produits provenant de revendeurs différents, comment déterminer s'il s'agit du même produit ?
Les revendeurs utilisent des conventions de nommage, des images, une catégorisation et une qualité de données différentes. Un même produit peut apparaître sous des noms, prix et descriptions variés chez plusieurs magasins.
VapaLape utilise une approche multicouche pour résoudre ce problème.
Techniques de rapprochement
Rapprochement lexical — PostgreSQL avec l'extension pg_trgm effectue une recherche de similarité par trigrammes sur les noms de produits, marques et descriptions. Cela permet de capturer les produits avec de légères variations textuelles.
Rapprochement sémantique — Les noms, descriptions et attributs sont convertis en vecteurs sémantiques (embeddings). Ces vecteurs capturent le sens du texte, permettant de rapprocher des produits même avec des mots complètement différents.
Recherche vectorielle — Les embeddings sont indexés avec pgvector et des index HNSW (Hierarchical Navigable Small World) pour une recherche de similarité efficace parmi des centaines de milliers de produits.
Score combiné — Les scores de similarité lexicale et sémantique sont combinés par pondération. Les produits avec un score élevé sont proposés comme correspondances, puis examinés par le processus de validation.
Modèle de produit canonique
Chaque groupe de fiches revendeurs rapprochées devient un produit canonique — un enregistrement normalisé unique représentant le produit réel. Cet enregistrement agrège les prix, les stocks et les métadonnées de tous les revendeurs vendant ce produit.
Le modèle canonique permet à VapaLape d'afficher une vue unifiée : une seule page produit avec les prix de tous les revendeurs, plutôt que des fiches séparées pour un même produit.
Validation humaine
Le rapprochement automatisé est puissant, mais pas parfait. VapaLape intègre un processus de validation humaine où les correspondances ambiguës ou à faible confiance sont examinées manuellement.
Cette approche hybride — rapprochement automatisé à grande échelle, revue humaine sur les cas limites — garantit à la fois une large couverture et une grande précision.
Indépendance des données
VapaLape n'est ni détenue ni contrôlée par un revendeur, un fabricant ou un réseau d'affiliation. Notre jeu de données est construit à partir d'observations publiques du marché, et non d'accords commerciaux.
Cette indépendance signifie que nos données reflètent le marché réel, et non une sélection de partenaires commerciaux. Nous incluons tout revendeur actif sur le marché français, indépendamment des relations commerciales.
La comparaison de prix est une application de ces données indépendantes. L'intelligence de marché — distribution des produits, évolution des prix, présence des marques et dynamique des revendeurs — est la capacité plus large.
Stack technique
Collecte de données : Scrapy (Python)
Stockage : PostgreSQL avec pg_trgm pour le rapprochement lexical et pgvector pour la recherche vectorielle
Indexation vectorielle : Index HNSW pour la recherche des plus proches voisins
Embeddings : Vecteurs sémantiques pour la similarité des noms, descriptions et attributs
Backend : Ruby on Rails (API)
Frontend : Next.js
Ce sont les composants principaux. Les versions et configurations évoluent avec la plateforme.
Amélioration continue
De nouveaux revendeurs sont ajoutés régulièrement. Les algorithmes de rapprochement sont affinés à mesure que le jeu de données grandit. Les retours de la validation humaine améliorent le rapprochement automatisé. La plateforme s'améliore en continu.
Les données que vous voyez aujourd'hui sont plus complètes et plus précises qu'hier — et le seront encore davantage demain.