← Le blog
Juridique

Web scraping et RGPD : ce que dit la loi en France

26/08/2026 · 8 min de lecture · par WyndPath

Le web scraping n'est pas interdit en France. C'est la première chose à savoir, et elle surprend souvent. Collecter automatiquement des informations publiquement accessibles est une pratique légale, largement utilisée pour la veille tarifaire, la recherche ou l'agrégation de données. Mais légal ne veut pas dire sans limites. Entre le droit des données personnelles, le droit des bases de données et les conditions d'utilisation des sites, le cadre est réel. Voici ce qu'il faut comprendre.

Avertissement. Cet article donne des repères généraux à jour de 2025-2026. Il ne remplace pas l'avis d'un juriste sur une situation précise. Chaque projet de collecte a ses spécificités.

Données personnelles : le RGPD s'applique, même en public

Une erreur répandue consiste à croire qu'une donnée publiquement accessible échappe au RGPD. C'est faux. Un nom, un e-mail, un profil visible en ligne restent des données personnelles, et leur collecte automatisée constitue un traitement soumis au règlement.

En juin 2025, la CNIL a publié deux fiches pratiques importantes, l'une sur l'intérêt légitime comme base légale pour l'entraînement de l'IA, l'autre spécifiquement sur la collecte par moissonnage. Le message est nuancé : le scraping de données personnelles peut reposer sur l'intérêt légitime, à condition de respecter une série de garde-fous.

Fait notable : la CNIL donne au fichier robots.txt un poids quasi normatif. L'ignorer affaiblit sérieusement la légitimité d'une collecte.

Le droit des bases de données

Deuxième pilier, distinct du RGPD : le droit dit « sui generis » des bases de données. Il protège l'investissement de celui qui a constitué une base, indépendamment de toute donnée personnelle. Extraire ou réutiliser une partie substantielle d'une base peut donc être sanctionné, même si les informations ne sont pas nominatives.

La jurisprudence française l'a rappelé récemment. En octobre 2025, la Cour de cassation a confirmé, dans une affaire opposant un site d'annonces automobiles à un métamoteur, que l'aspiration massive d'annonces pouvait porter atteinte à ce droit sui generis. Plus tôt, une affaire concernant un grand site de petites annonces avait abouti à la condamnation d'un scraper, avec des dommages au titre du préjudice financier et de l'atteinte à l'image.

Les conditions d'utilisation comptent aussi

Un troisième niveau est souvent oublié : le contrat. La Cour de justice de l'Union européenne a jugé, dans l'affaire Ryanair, que des données non couvertes par le droit des bases pouvaient tout de même être verrouillées par les conditions générales d'un site. Accepter les CGU, puis les enfreindre en aspirant le contenu, expose à une action contractuelle. À l'inverse, une autre décision européenne a rappelé qu'il fallait équilibrer la protection du producteur et l'accès légitime des tiers.

Quand la sanction tombe : l'exemple Clearview

Pour mesurer le sérieux du sujet, un cas fait référence. L'entreprise Clearview AI, qui a constitué une base de reconnaissance faciale en aspirant des milliards d'images sur le web sans base légale, a écopé d'une amende de 20 millions d'euros de la CNIL en 2022, suivie d'une astreinte pour non-exécution, et d'autres sanctions en Europe. Le message est clair : le scraping de données biométriques sans consentement, à grande échelle, coûte très cher.

Une grille de lecture simple

Pour un projet de collecte, quatre questions permettent de se situer :

Collecter proprement, techniquement aussi

Le respect du droit a un versant technique. Limiter sa cadence pour ne pas surcharger un serveur, respecter les règles publiées, ne prendre que la donnée utile : ce sont des pratiques qui protègent à la fois le site visé et le collecteur. WyndPath intègre cette logique, avec une limitation de débit et le respect des directives des sites. La technique ne dispense jamais du cadre légal, mais elle aide à rester du bon côté.

Sources · CNIL, fiches sur l'intérêt légitime et le moissonnage (juin 2025) et délibération 2025-041 · Cour de cassation, arrêt du 15 octobre 2025 (droit sui generis des bases de données) · CJUE, affaires Ryanair (C-30/14) et CV-Online Latvia (C-762/19) · CNIL et autorités européennes, sanctions Clearview AI (2022-2024). Contenu informatif, ne constitue pas un conseil juridique.

Récupérer cette donnée, sans se faire bloquer

WyndPath gère proxys, rendu JavaScript et passage anti-bot en un seul appel API. Payé au succès.

Démarrer gratuitement →
À lire aussi · Chiffres
Quelle part du trafic web est générée par des bots ?
À lire aussi · Technique
Comment fonctionnent les systèmes anti-bot