Comment scraper PagesJaunes en 2026 (guide complet)

PagesJaunes est l'annuaire professionnel de référence en France : coordonnées, horaires, catégories d'activité de millions d'entreprises. C'est une source précieuse pour la prospection et la constitution de bases sectorielles. Le site est protégé par DataDome, et la collecte de coordonnées d'entreprises touche directement au RGPD. Voici comment aborder le sujet sérieusement.
Quelles données récupérer sur PagesJaunes
- Coordonnées : nom, adresse, téléphone public, site web.
- Activité : catégorie, sous-catégories, mots-clés.
- Horaires : ouverture, jours, éventuels services.
- Avis : note et nombre d'avis publics.
Ce qui bloque un scraper classique
PagesJaunes utilise DataDome. Un simple client HTTP est vite redirigé vers une page de vérification. DataDome combine réputation de l'IP, empreinte TLS et navigateur, et analyse du comportement. Une adresse de datacenter ou une empreinte de script sont filtrées immédiatement.
Comment récupérer la donnée proprement
curl -G "https://api.wyndpath.com/v1/" \
--data-urlencode "api_key=VOTRE_CLE" \
--data-urlencode "url=https://www.pagesjaunes.fr/recherche/paris-75/plombier" \
--data-urlencode "render_js=1" \
--data-urlencode "country=fr"
WyndPath passe DataDome avec un vrai navigateur et une IP française, au succès. Pour parcourir plusieurs pages, gardez la même session et espacez les requêtes.
Le cadre légal
C'est le point le plus sensible ici. La CNIL encadre strictement la constitution de fichiers de prospection par moissonnage : intérêt légitime sous conditions, respect du robots.txt, exclusion des données sensibles, information et droit d'opposition. Lisez impérativement notre article web scraping et RGPD en France avant tout projet, et limitez-vous au strict nécessaire.
Récupérer les données de PagesJaunes, sans vous faire bloquer
WyndPath gère proxys, rendu JavaScript et passage anti-bot en un seul appel API. Payé au succès, dans le respect des règles publiées par les sites.
Démarrer gratuitement →