VROF

Guide

Web scraping : jusqu'où c'est permis — les 4 critères pour collecter des données en toute légalité

Le web scraping peut se faire en toute légalité. Dans la décision 2021도1533, la Cour suprême (대법원) a jugé les trois chefs d’accusation — violation de la loi sur les réseaux d’information et de communication (정보통신망법), entrave à l’activité au moyen de systèmes informatiques (컴퓨터등장애업무방해), violation du droit d’auteur (저작권법) — tous non coupables pour une collecte d’informations sur le serveur d’API d’une application concurrente. Là où les choses se divisent, c’est sur la cible et la méthode — trois points.

Domaine Base légale À vérifier dans la conception
Droits d’accès Loi sur les réseaux d’information et de communication (정보통신망법) §48① Mesures de protection telles que la connexion ou le CAPTCHA ; les conditions d’utilisation interdisent-elles la collecte
Données personnelles Loi sur la protection des informations personnelles (개인정보보호법) §15① Des noms ou des coordonnées s’y mêlent-ils. Si oui, on fixe d’abord la base légale
Œuvres et bases de données Loi sur le droit d’auteur (저작권법) §16, §93①② Copier le tout pour le retraiter, ou n’utiliser que la partie nécessaire

① Droits d’accès — êtes-vous entré dans un endroit restreint

L’article 48, alinéa 1 de la loi sur les réseaux d’information et de communication (정보통신망법) interdit de « pénétrer dans un réseau d’information et de communication sans droit d’accès légitime, ou au-delà du droit d’accès autorisé ».

Jusqu’où s’étend un « endroit restreint », la Cour suprême l’a établi.

La question de savoir si le fournisseur de services a restreint le droit d’accès doit être jugée avec prudence, en considérant de manière globale les circonstances objectivement révélées, telles que les mesures de protection ou les conditions d’utilisation.

— Cour suprême (대법원), décision 2021도1533 rendue le 12 mai 2022

robots.txt n’est pas une mesure de protection. La norme (RFC 9309) précise elle-même qu’il n’est « pas un substitut à des moyens efficaces de sécurisation des contenus ». Le violer ne rend pas immédiatement illégal, et le respecter ne garantit pas la légalité. Lisez-le et respectez-le, mais cela seul ne suffit pas à vous rassurer.

② Données personnelles — des informations sur des personnes s’y mêlent-elles

L’article 15, alinéa 1 de la loi sur la protection des informations personnelles (개인정보보호법) énumère de manière limitative les cas où la collecte et l’utilisation sont permises (consentement, dispositions particulières de la loi, conclusion et exécution d’un contrat, etc.).

Si des noms, des coordonnées ou des adresses s’y mêlent, vous êtes soumis à une réglementation distincte, indépendamment du scraping. On fixe d’abord l’objectif et la base légale, puis on commence.

③ Œuvres et bases de données — combien vous emportez

Le producteur d’une base de données a « le droit de reproduire, distribuer, diffuser ou transmettre le tout ou une partie substantielle » (loi sur le droit d’auteur (저작권법) §93①).

C’est ici que la pratique se trompe. Un seul élément n’est pas une « partie substantielle », mais racler petit à petit et sur la durée n’est pas permis pour autant — si l’opération, répétée et systématique, aboutit au final au même résultat qu’une reproduction d’une partie substantielle, elle est considérée comme une violation (§93②).

Il vous suffit de disposer de la cible et du mode de collecte souhaités. Nous définissons sans frais une architecture de collecte conforme et le périmètre de faisabilité, si vous envisagez d’externaliser, la réalisation concrète débutant à partir de 150 000 wons.

→ Consulter la Grille tarifaire et nos Réalisations · Demander le périmètre

À respecter en dehors des trois

  • On ne charge pas le serveur — on garde la fréquence de collecte au niveau d’un usage humain et on limite le nombre de requêtes parallèles. Tout envoyer d’un coup en fait une manière de perturber le service d’un tiers.
  • On ne cache pas que l’on est un robot — on met l’objectif et un contact dans le User-Agent.

Ordre de vérification

  1. Lire vous-même les conditions d’utilisation et robots.txt du site cible
  2. Déterminer si ce qui est collecté est une donnée personnelle ou une partie substantielle de la base de données
  3. Si le dossier est embrouillé, faire examiner par un expert juridique

Il y a une raison pour laquelle l’étape 1 vient en premier. En dehors du droit, il existe des cas où les conditions d’utilisation fixent le périmètre — notamment les systèmes destinés aux vendeurs et gérants, utilisés après connexion. Avant d’être une question juridique, c’est une question contractuelle : en regardant d’abord, on n’a rien à refaire ensuite.

Une chose encore. 2021도1533 est une affaire pénale. Le fait qu’un acquittement soit intervenu au pénal ne doit pas être lu comme l’absence de toute responsabilité civile.

En résumé

La plupart des collectes peuvent se faire sans problème. C’est précisément pour cela que la Cour suprême a acquitté sur les trois chefs — il suffit de ne pas entrer dans un endroit verrouillé, de ne pas toucher aux données personnelles, de ne pas déplacer en bloc la base de données d’autrui et de ne pas faire souffrir le serveur.

Ce qui bloque, d’habitude, ce n’est pas « est-ce possible » mais « jusqu’où ». Tracez cette ligne d’abord, et il n’y aura rien à défaire après la construction.

Quand vous jugez par vous-même, ce qui coince en réalité n’est pas l’interprétation du droit mais la suite — quand les conditions d’utilisation ne disent rien, quand la cible est un écran derrière une connexion, quand il est ambigu de savoir si des données personnelles s’y mêlent. Ces cas-là ne se tranchent pas en lisant les seuls articles ; le jugement ne se fixe qu’en examinant la conception de la collecte en même temps. Demandez un examen de la conception de la collecte et nous vous le présentons cible par cible.


Il suffit de l’adresse du site que vous voulez collecter.

Dites-nous sur une ligne ce que vous voulez récolter, nous vérifions d’abord les conditions d’utilisation, robots.txt et la présence éventuelle de données personnelles, puis nous vous présentons si c’est possible et jusqu’où. Vous décidez du démarrage du développement après l’examen.

Demander si la collecte est possible · Voir ce que nous avons fait


Références

  • Loi sur les réseaux d’information et de communication (정보통신망법), article 48, alinéa 1 · Loi sur la protection des informations personnelles (개인정보보호법), article 15, alinéa 1 · Loi sur le droit d’auteur (저작권법), articles 16, 93, alinéas 1 et 2 [vérifié — Centre national d’information juridique (국가법령정보센터)]
  • Décision de la Cour suprême (대법원) 2021도1533, rendue le 12 mai 2022 [vérifié — texte original du jugement. Les trois chefs d’accusation poursuivis ont tous abouti à un acquittement]
  • RFC 9309 Robots Exclusion Protocol [vérifié — IETF, 2022]

Sources de cet article

Les textes de loi ont été recoupés avec l'original du Centre national d'information juridique (국가법령정보센터) — loi sur les réseaux d'information et de communication (정보통신망법), article 48, alinéa 1 ; loi sur le droit d'auteur (저작권법), articles 16, 93, alinéas 1 et 2 ; loi sur la protection des informations personnelles (개인정보보호법), article 15 (vérification du 2026-08-16). La jurisprudence citée est la décision de la Cour suprême (대법원) 2021도1533, rendue le 12 mai 2022 (pénale ; les trois chefs d'accusation poursuivis ont tous abouti à un acquittement). La nature de robots.txt a été vérifiée sur le texte original de la RFC 9309 (IETF, 2022).

Services associés

Réalisations sur ce sujet

Voir toutes les réalisations →

Autres articles sur ce sujet

Des conseils pour vous faire gagner du temps Consultation gratuite · Réponse sous 1 jour ouvré

Contact