Une collecte qui repère les vendeurs de produits vendus sous le nom de la marque sans autorisation
Pour le travail de protection des droits d'auteur et des marques d'une fondation culturelle publique, nous avons collecté automatiquement, sur les boutiques en ligne, les vendeurs des produits vendus sous le nom de la marque de la fondation. L'agrégation se fait par vendeur, et non par produit.
Vendeurs identifiés
Avant
Vérification individuelle des résultats de recherche
Après
Collecte automatique de toutes les pages
Contexte
Les produits culturels créés par la fondation portent une marque. Et des produits vendus sous ce nom de marque, sans autorisation officielle, apparaissent sur les boutiques en ligne. Protéger les droits d’auteur et la marque commence par savoir où ils sont vendus.
Ce que nous avons vu sur place
Les résultats de recherche des boutiques sont découpés en pages, et le même vendeur y apparaît plusieurs fois, à travers des produits différents. Quand une personne examine les résultats à l’œil nu, elle en manque au fil des pages suivantes, et revérifie des vendeurs déjà vus plus tôt. La qualité de la vérification dépend du nombre de pages de résultats.
Le problème tel que nous l’avons défini
Ce qu’il fallait trouver, c’était le vendeur, et non le produit. En comptant par produit, le même endroit était compté plusieurs fois, et l’on ne pouvait pas savoir en combien d’endroits une action était réellement nécessaire. Changer l’unité de comptage était le cœur de ce travail.
Ce que nous avons construit
- Parcours de toutes les pages de résultats — recherche par nom de marque, puis passage jusqu’à la dernière page, 40 résultats par page
- Vérification croisée du nom de produit — seuls sont conservés les produits dont le nom de produit contient réellement le nom de la marque
- Dédoublonnage par vendeur — le même vendeur n’est enregistré qu’une seule fois. Le nombre de cibles d’action correspond exactement au nombre de vendeurs
- Export Excel — le nom du produit, l’adresse du vendeur et la position dans les résultats de recherche sont conservés ensemble, afin de pouvoir les retrouver
Ce que nous avons évité
- On avance en marquant des pauses — à chaque changement de page, un temps d’attente aléatoire. Ne pas enchaîner sans répit est ce qui permet d’aller jusqu’aux dernières pages sans interruption
- On va jusqu’au bout — dans les résultats de recherche, les endroits qui ne sont pas des vendeurs officiels se concentrent vers la fin plutôt qu’au début. Ne regarder que les premières pages ferait manquer ce qu’il faut trouver
- Les doublons sont filtrés par vendeur — même si un même endroit propose dix produits, il n’en reste qu’un. Le nombre de cibles d’action n’est pas gonflé
Résultats
Le périmètre commandé a été achevé et livré.
D’autres travaux réalisés de la même manière sont rassemblés sous Collecte de données web.
Sources des faits
Script de collecte