# Scraping

> Le scraping est l'extraction automatisée de données depuis des pages web. Il sert autant à la veille légitime qu'à la copie de contenu, et tout site public en fait l'objet.

**Source :** https://www.scaly.co/ressources/glossaire/scraping
**Glossaire :** https://www.scaly.co/ressources/glossaire
**Auteur :** Axel Malischewski, fondateur de scaly — https://www.scaly.co/auteur/axel-malischewski
**Rubrique :** Technique
**Mis à jour le :** 2026-08-10

---

## Qu'est-ce que le scraping ?

Le scraping est l'extraction automatisée de données depuis des pages web. Il sert autant à la veille légitime qu'à la copie de contenu, et tout site public en fait l'objet.

## Un même procédé, des usages opposés

Un moteur de recherche, un comparateur de prix et un concurrent qui recopie vos fiches utilisent la même technique. Ce qui les distingue est l'usage fait des données, pas le procédé.

Côté droit européen, la collecte de données publiques n'est pas interdite en soi, mais la reproduction d'un contenu protégé, l'extraction substantielle d'une base de données et la collecte de données personnelles relèvent chacune d'un régime précis.

## Se protéger sans se rendre invisible

- Limiter la cadence par adresse plutôt que bloquer largement : un blocage trop zélé attrape aussi les moteurs.
- Surveiller les journaux du serveur pour repérer les schémas d'accès anormaux.
- Publier vite et faire indexer d'abord : l'antériorité constatée protège mieux qu'un blocage.
- Suivre les copies avec une recherche d'extraits exacts, et signaler les infractions caractérisées.

## Exemple concret

Les textes de cas clients d’une agence de design réapparaissent mot pour mot sur le site d’un concurrent, découpage des sections compris. Une recherche entre guillemets sur une phrase entière suffit à lister les pages copiées. Les journaux du serveur montrent un même bloc d’adresses parcourir le portfolio chaque nuit. Limiter la cadence sur ce bloc ralentit la copie sans gêner les robots des moteurs.

## À retenir

Un contenu public sera copié. Ce qui ne se copie pas — vos chiffres, vos captures, vos cas clients — est aussi ce qui vous distingue dans les résultats.

## Questions fréquentes

### Le contenu dupliqué par un tiers pénalise-t-il mon site ?

Rarement : Google identifie généralement la source d'origine. Le risque existe si la copie est mieux référencée que l'original.

### Peut-on bloquer le scraping ?

Pas complètement. On élève le coût — limitation de cadence, détection de comportements — sans jamais rendre l'extraction impossible.

### Le robots.txt empêche-t-il le scraping ?

Non. Il est respecté par les robots sérieux et ignoré par les autres. Ce n'est pas un mécanisme de protection.
