Cabinet Kohen Avocats · Paris

—

Maître Reda KOHEN intervient en droit immobilier, droit des sociétés et droit des affaires à Paris. Première analyse : 80 € TTC, réponse personnelle sous 24 heures.

100 % confidentiel · Secret professionnel · Sans engagement

Barreau de Paris Immobilier, sociétés, affaires Fiche CNB avocat.fr
Maître Reda KOHEN, avocat au Barreau de Paris
Maître Reda KOHEN
Avocat au Barreau de Paris

Web scraping et IA générative : peut-on légalement aspirer les données d’un site en 2026 ?

Web scraping et IA générative : peut-on légalement aspirer les données d’un site en 2026 ?

Le 7 juillet 2026, le Comité européen de la protection des données a adopté de nouvelles lignes directrices sur le moissonnage dans le contexte de l’intelligence artificielle générative. La CNIL les a présentées le 9 juillet. Leur message est net : une donnée visible sur Internet ne devient pas librement exploitable. Le RGPD s’applique dès que le robot collecte, enregistre, classe ou extrait des données permettant d’identifier une personne. L’entreprise qui entraîne un modèle, enrichit un fichier de prospection, surveille des prix ou agrège des annonces doit donc examiner la finalité, la base légale, les données sensibles, l’information des personnes et les mesures de minimisation.

Le RGPD n’est pourtant qu’un étage du risque. Le site aspiré peut constituer une base protégée par le Code de la propriété intellectuelle. Des extractions répétées peuvent excéder son utilisation normale. Le contournement d’un contrôle d’accès peut relever du droit pénal. La reprise des efforts ou des investissements d’un concurrent peut enfin nourrir une action en parasitisme, même sans copie servile ni risque de confusion. Avant de lancer un scraper, il faut donc répondre à quatre questions distinctes : quelles données seront collectées, par quel moyen, dans quel volume et pour quel usage ? Le présent décryptage expose les vérifications à conduire, les preuves à conserver et les premières mesures à prendre lorsqu’un éditeur, une plateforme ou la CNIL conteste la collecte.

I. Web scraping légal en France : quelles données pouvez-vous collecter ?

A. Le RGPD autorise-t-il le scraping de données publiquement accessibles pour entraîner une IA ?

Le web scraping désigne l’extraction automatisée d’informations depuis des pages, des interfaces ou des services en ligne. La technique n’est pas interdite par nature. Sa licéité dépend des données ciblées, de l’architecture du site, des signaux d’opposition, de la fréquence des requêtes et de l’usage ultérieur. Un même script peut être licite lorsqu’il relève des prix publics à faible fréquence et illicite lorsqu’il contourne un espace authentifié pour constituer des profils de personnes.

La première qualification porte sur les données personnelles. Un nom, une photographie, un pseudonyme stable, une adresse électronique, un numéro de téléphone, une URL de profil, une opinion, une localisation ou un identifiant technique peuvent permettre une identification directe ou indirecte. Le caractère public de la page ne fait pas disparaître cette qualification. Il ne vaut ni consentement général, ni renonciation aux droits, ni autorisation de réutiliser les informations pour une finalité sans rapport avec leur publication.

La présentation publiée par la CNIL le 9 juillet 2026 résume les nouvelles lignes directrices du CEPD. Elle rappelle mot pour mot : « Le RGPD s’applique au moissonnage lorsqu’il inclut des opérations de traitement de données à caractère personnel, telles que la collecte, le stockage, l’organisation et l’extraction. » Une entreprise ne peut donc pas repousser l’analyse au moment où le jeu de données alimentera le modèle. Le traitement commence dès la collecte.

Le responsable du projet doit définir une finalité déterminée. « Entraîner une IA » ne suffit pas si cette formule recouvre des usages indéfinis. Il faut préciser le type de modèle, les fonctions recherchées, les catégories d’utilisateurs, les sorties attendues et les réutilisations prévues. Cette description commande le choix des sources et des champs. Une donnée utile à un système de recommandation de produits ne l’est pas nécessairement à un outil de génération de texte. La collecte de précaution, destinée à conserver tout ce qui pourrait devenir utile, contredit le principe de minimisation.

La base légale doit être arrêtée avant l’extraction. Dans de nombreux projets privés, l’intérêt légitime sera envisagé. Il ne constitue pas une formule automatique. L’entreprise doit identifier un intérêt réel et actuel, démontrer que la collecte est nécessaire et mettre en balance cet intérêt avec les droits et attentes raisonnables des personnes. Elle examine notamment la nature de la page, le contexte de publication, le volume, le profilage, les conséquences possibles, les mécanismes d’opposition et les mesures qui réduisent l’atteinte.

La fiche de la CNIL consacrée à l’intérêt légitime et au moissonnage recommande d’exclure les sites qui manifestent une opposition au scraping, notamment par des mesures techniques ou des conditions accessibles. Les fichiers robots.txt et les dispositifs anti-robot ne créent pas seuls toute la règle juridique, mais ils matérialisent l’attente du site et pèsent dans l’analyse. Leur contournement fragilise aussi l’argument selon lequel les personnes pouvaient raisonnablement anticiper la collecte.

Les nouvelles lignes directrices attirent une attention particulière sur les données sensibles. Les informations révélant l’origine raciale ou ethnique, les opinions politiques, les convictions, l’appartenance syndicale, la santé, la vie sexuelle ou l’orientation sexuelle relèvent de l’article 9 du RGPD. Leur présence incidente dans un corpus ne dispense pas d’identifier une exception applicable. Le CEPD souligne qu’il n’existe pas d’exemption générale pour les jeux destinés à l’IA. Une entreprise qui aspire des biographies, des forums, des commentaires ou des réseaux sociaux doit prévoir des filtres en amont et des contrôles après collecte.

L’exactitude devient également une exigence opérationnelle. Une page peut être ancienne, parodique, erronée ou attribuée à la mauvaise personne. Le CEPD recommande de sélectionner des sources fiables, d’enregistrer l’horodatage et de valider les données avant leur utilisation pour la formation. Cette traçabilité ne sert pas seulement au RGPD. Elle permet de retirer un élément, répondre à une demande d’effacement, analyser une sortie litigieuse et démontrer la provenance des données.

L’information des personnes doit être organisée. Lorsque les données ne sont pas obtenues directement auprès d’elles, l’article 14 du RGPD impose en principe de communiquer l’identité du responsable, les finalités, la base légale, les catégories de données, les destinataires, la durée de conservation, la source et les droits. Une exception liée à l’impossibilité ou aux efforts disproportionnés doit être justifiée, non simplement affirmée. Même lorsqu’une information individuelle n’est pas réalisable, une notice publique accessible, une documentation des sources et des mécanismes effectifs d’exercice des droits demeurent nécessaires.

Le droit pénal français ajoute un risque propre à la déloyauté de la collecte. L’article 226-18 du Code pénal dispose : « Le fait de collecter des données à caractère personnel par un moyen frauduleux, déloyal ou illicite est puni de cinq ans d’emprisonnement et de 300 000 euros d’amende. » Le procédé technique, les fausses identités, la dissimulation, le contournement et la finalité réelle peuvent donc être examinés indépendamment de la seule base légale invoquée dans la documentation RGPD.

La finalité déclarée doit ensuite rester celle qui gouverne l’usage. L’article 226-21 du Code pénal réprime le détournement de données personnelles de la finalité du traitement automatisé. La Cour de cassation, chambre criminelle, 13 janvier 2026, n° 25-80.474, rappelle exactement : « Selon le premier de ces textes, l’infraction de détournement de la finalité d’un traitement de données à caractère personnel suppose que ces données soient contenues dans un traitement automatisé. » L’entreprise doit donc contrôler les usages secondaires, les transferts internes et les demandes de nouvelles équipes.

Une analyse d’impact peut être requise lorsque la collecte engendre un risque élevé pour les droits et libertés. Le volume massif, le rapprochement de sources, les données sensibles, la surveillance systématique, la notation ou l’usage concernant des personnes vulnérables sont des signaux importants. L’analyse décrit le traitement, évalue sa nécessité et sa proportionnalité, recense les risques, puis fixe des mesures vérifiables. Elle doit précéder le lancement et évoluer avec le projet.

La réponse pratique n’est donc ni « tout ce qui est public est libre », ni « tout scraping est interdit ». Un projet peut reposer sur un intérêt légitime lorsqu’il poursuit une finalité précise, limite les sources et les champs, respecte les oppositions, filtre les données sensibles, organise l’information, conserve la provenance et permet l’exercice des droits. L’entreprise doit être capable de démontrer chaque étape.

B. Le propriétaire du site peut-il interdire l’extraction de sa base ou invoquer un accès frauduleux ?

La deuxième analyse porte sur le contenu du site lui-même. Les faits bruts ne sont pas nécessairement protégés par le droit d’auteur. Leur organisation, leur sélection, leurs investissements et leur présentation peuvent néanmoins relever de plusieurs fondements. Il faut séparer le droit d’auteur sur des éléments originaux, le droit du producteur de base de données, le contrat, la responsabilité civile et les atteintes à un système de traitement automatisé.

L’article L. 341-1 du Code de la propriété intellectuelle protège le producteur qui prend l’initiative et le risque des investissements lorsque la constitution, la vérification ou la présentation du contenu atteste un investissement financier, matériel ou humain substantiel. La protection n’est pas présumée par la seule existence d’un site. L’éditeur doit identifier l’investissement consacré à la base, distinct de la création des données lorsque cette distinction est pertinente.

L’article L. 342-1 du même code permet d’interdire l’extraction ou la réutilisation de la totalité ou d’une partie qualitativement ou quantitativement substantielle. Le volume ne se mesure pas seulement au nombre de lignes. Une petite partie peut présenter une importance qualitative lorsqu’elle concentre l’investissement ou la valeur recherchée. Le projet doit donc documenter la part collectée, la fréquence, les champs et la destination.

Une stratégie fondée sur de petites requêtes successives n’écarte pas le risque. L’article L. 342-2 du Code de la propriété intellectuelle autorise le producteur à interdire « l’extraction ou la réutilisation répétée et systématique de parties qualitativement ou quantitativement non substantielles » lorsque les opérations excèdent les conditions d’utilisation normale de la base. Un robot qui prélève chaque jour les nouvelles annonces peut ainsi être apprécié sur la durée et par son effet cumulé.

Le contrat peut ajouter des restrictions, à condition d’être opposable. L’entreprise vérifie les conditions générales, les modalités d’acceptation, les mentions accessibles aux robots, les licences et les autorisations de l’API. Une interdiction rédigée après le début de la collecte ne règle pas automatiquement le passé. À l’inverse, la création de comptes successifs, l’usage d’adresses tournantes ou le contournement d’un plafond contractuel démontrent une volonté difficilement conciliable avec une collecte loyale.

Le droit pénal intervient lorsqu’un accès ou un maintien devient frauduleux. L’article 323-1 du Code pénal punit l’accès ou le maintien frauduleux dans tout ou partie d’un système de traitement automatisé de données. L’article 323-3 du Code pénal vise notamment le fait d’extraire, détenir, reproduire ou transmettre frauduleusement les données contenues dans un tel système. Le simple usage d’un navigateur ou d’un script ordinaire n’exclut pas l’infraction si l’utilisateur sait que l’accès n’est pas autorisé.

La Cour de cassation, chambre criminelle, 20 mai 2015, n° 14-81.336, a traité un accès initial rendu possible par une défaillance technique. Elle retient mot pour mot que l’intéressé « s’est maintenu dans un système de traitement automatisé après avoir découvert que celui-ci était protégé et a soustrait des données qu’il a utilisées sans le consentement de leur propriétaire ». Le point de bascule est concret : la découverte du contrôle d’accès et la poursuite du téléchargement malgré cette connaissance.

Une page techniquement accessible ne doit donc pas être assimilée à une autorisation illimitée. L’équipe examine si elle a atteint un répertoire inattendu, une interface non destinée au public, une URL non référencée, un stockage mal configuré ou des données normalement placées derrière une authentification. Si le robot révèle ce type d’accès, l’extraction doit être interrompue et escaladée. La répétition après constat augmente le risque.

Le parasitisme constitue un autre fondement, distinct de la propriété intellectuelle. L’article 1240 du Code civil pose la responsabilité pour faute. La Cour de cassation, chambre commerciale, 16 février 2022, n° 20-13.542, définit ainsi le mécanisme : « L’action en parasitisme, fondée sur l’article 1382, devenu 1240, du code civil, qui implique l’existence d’une faute commise par une personne au préjudice d’une autre, peut être mise en oeuvre quels que soient le statut juridique ou l’activité des parties, dès lors que l’auteur se place dans le sillage de la victime en profitant indûment de ses efforts, de son savoir-faire, de sa notoriété ou de ses investissements. »

Le demandeur doit toutefois identifier ce qui aurait été capté. Dans l’arrêt du 26 juin 2024, chambre commerciale, n° 23-13.535, la Cour énonce exactement : « Le parasitisme économique est une forme de déloyauté, constitutive d’une faute au sens de l’article 1240 du code civil, qui consiste, pour un opérateur économique, à se placer dans le sillage d’un autre afin de tirer indûment profit de ses efforts, de son savoir-faire, de la notoriété acquise ou des investissements consentis. » Elle exige ensuite l’identification d’une valeur économique individualisée et d’une volonté de se placer dans le sillage d’autrui.

Cette exigence évite qu’un acteur privatise une idée ou une information banale. La Cour de cassation, chambre commerciale, 20 septembre 2016, n° 14-25.131, approuve une décision ayant retenu que « la société […] n’établit pas quel serait son style particulier qui constituerait une valeur économique individualisée, fruits d’investissements, que les sociétés H&M AB et H&M auraient voulu copier ». Le propriétaire du site doit donc prouver la valeur invoquée, et non seulement l’existence d’une reprise.

La longévité d’un service et son succès ne suffisent pas davantage. La Cour de cassation, chambre commerciale, 5 juillet 2016, n° 14-10.108, censure des motifs impropres à établir un profit indu, les efforts « ne pouvant se déduire de la seule longévité et du succès de la commercialisation » du produit concerné. Pour un site, les investissements techniques, éditoriaux, humains et commerciaux doivent être isolés et rapprochés de ce que le scraper a effectivement exploité.

À l’inverse, l’absence de confusion ne neutralise pas le parasitisme. La Cour de cassation, chambre commerciale, 27 juin 1995, n° 93-18.601, a reproché aux juges de ne pas avoir répondu au moyen tiré du « comportement parasitaire […] résultant à la fois de la notoriété, auprès de la clientèle, du conditionnement […] et de la volonté […] de se placer dans son sillage ». Un agrégateur peut afficher sa propre marque tout en tirant indûment profit de la base, de la classification ou de la fréquence de mise à jour d’un concurrent.

La démonstration demeure globale. Dans l’arrêt du 10 juillet 2018, chambre commerciale, n° 16-23.694, la Cour rappelle : « le parasitisme consiste, pour un opérateur économique, à se placer dans le sillage d’un autre afin de tirer profit, sans rien dépenser, de ses efforts et de son savoir-faire, de la notoriété acquise ou des investissements consentis ». Le coût évité par l’aspiration, l’identité des champs, la rapidité de republication, le modèle économique et les démarches de contournement deviennent alors des preuves utiles.

Enfin, l’usage de caractéristiques connues peut révéler la volonté de capter des investissements. La Cour de cassation, chambre commerciale, 3 juillet 2001, n° 98-23.236, retient que la reprise d’une combinaison de caractéristiques permettait de déduire « la volonté […] de se placer dans le sillage […] et de profiter de ses investissements publicitaires ». Transposée avec prudence au scraping, cette logique invite à comparer non seulement les données brutes, mais aussi leur sélection, leur agencement et leur exploitation commerciale.

Un projet juridiquement défendable sépare donc cinq autorisations : accès technique, droit contractuel, droit sur la base, droit sur les contenus et droit de traiter les données personnelles. L’autorisation sur un niveau ne couvre pas automatiquement les autres. Une API ouverte peut être assortie d’une licence restrictive. Une base non protégée par le droit sui generis peut contenir des données personnelles. Une collecte conforme au RGPD peut encore violer un contrat ou révéler un comportement parasitaire.

II. Web scraping en entreprise : comment sécuriser le projet et répondre à une contestation ?

A. Quelle checklist appliquer avant de scraper un site ou d’acheter un jeu de données ?

La première étape consiste à rédiger une fiche de traitement compréhensible sans code. Elle indique la finalité, les sites ciblés, les catégories de pages, les champs collectés, la fréquence, le volume, la durée, les destinataires, le lieu d’hébergement et les usages du modèle. Elle identifie le responsable de chaque décision. Un projet dont la finalité reste mouvante doit être resserré avant le développement.

La deuxième étape est une cartographie des sources. Pour chaque domaine, l’entreprise conserve l’URL, la date de revue, la présence d’une authentification, les conditions d’utilisation, la licence, les instructions robots.txt, les dispositifs anti-robot, l’existence d’une API et les coordonnées de l’éditeur. La revue est renouvelée, car ces éléments évoluent. Un changement important doit pouvoir suspendre automatiquement la collecte.

La troisième étape est la sélection des données. Les champs inutiles sont exclus dès le code de collecte. Lorsque des données personnelles apparaissent dans une zone non nécessaire, le robot ne doit pas les aspirer au motif qu’un nettoyage interviendra plus tard. La minimisation à la source réduit les risques de sécurité, les coûts de filtrage et la difficulté des demandes d’exercice de droits.

Les catégories sensibles appellent des règles de blocage. L’équipe définit des sources interdites, des termes ou métadonnées d’alerte, des filtres, des seuils et une revue humaine. Elle teste les faux négatifs. Une simple liste de mots-clés ne suffit pas lorsque le contexte révèle une donnée de santé, une opinion ou une orientation. Si le traitement de telles données n’a pas de fondement clair, elles doivent être exclues.

La base légale et la mise en balance sont documentées. Le dossier décrit l’intérêt poursuivi, sa légitimité, la nécessité du scraping et les solutions moins intrusives envisagées. Il évalue les attentes des personnes, la nature des données, l’échelle, les effets et les garanties. Les mesures compensatoires peuvent comprendre l’exclusion de certaines pages, une fréquence limitée, une durée courte, une pseudonymisation, une information publique, un portail de droits et l’absence de profilage individuel.

Les droits de propriété intellectuelle font l’objet d’une analyse distincte. L’entreprise estime la portion extraite, l’importance qualitative des champs, la répétition et la réutilisation. Elle recherche les investissements du producteur lorsqu’ils sont connus. Si le projet dépend durablement d’une source, une licence ou un partenariat réduit souvent davantage le risque qu’une architecture complexe de contournement.

Le rythme des requêtes doit préserver le service. Des limites de débit, des fenêtres horaires, une identification du robot, une adresse de contact et un mécanisme d’arrêt sont définis. Le projet n’utilise pas de comptes fictifs, de captchas résolus illicitement, de rotation d’adresses destinée à contourner un blocage ou d’accès empruntés à des utilisateurs. Tout blocage nouveau déclenche une revue, non une escalade technique automatique.

La sécurité du corpus est pensée dès la collecte. Les données sont chiffrées, les accès limités, les exportations journalisées et les environnements séparés. Les développeurs n’utilisent pas un échantillon réel sur des postes ou services personnels. Les sauvegardes respectent la durée de conservation. La suppression doit atteindre les jeux dérivés lorsque cela est techniquement possible et juridiquement requis.

La provenance est attachée aux données. Chaque lot comporte la source, l’heure, la version du collecteur, les règles de filtrage et les transformations. Cette lignée permet de retirer une source contestée, mesurer son influence et répondre à une personne. Pour un modèle d’IA, elle facilite aussi l’évaluation de la qualité, des biais et des droits attachés aux contenus.

Une procédure d’exercice des droits doit être testée avant le lancement. L’entreprise vérifie qu’elle peut retrouver les données d’une personne, les communiquer, les rectifier, les effacer ou limiter leur usage. Elle détermine comment la demande sera propagée aux jeux nettoyés, aux index et aux destinataires. Si le modèle ne permet pas un effacement simple, cette contrainte doit être intégrée à l’analyse initiale et aux choix d’architecture.

Le contrat avec un prestataire de données mérite une revue précise. Une garantie générale de conformité ne remplace pas la description des sources et des méthodes. Le fournisseur doit indiquer l’origine, la date, la base légale, les restrictions, les catégories sensibles, les mécanismes d’opposition et les sous-traitants. Le client organise un droit d’audit, une obligation d’alerte, une assistance aux droits et un régime de suppression. Il conserve sa propre analyse, car l’achat n’efface pas sa responsabilité.

Les équipes commerciales et produit ne doivent pas promettre un usage plus large que celui validé. Les nouvelles finalités suivent une procédure de changement. L’ajout d’un scoring, d’un enrichissement de prospects, d’une surveillance de salariés ou d’un transfert à un client peut modifier la base légale et les risques. Le comité de validation doit pouvoir dire non, limiter un pilote ou imposer une nouvelle analyse d’impact.

Une phase pilote réduit l’échelle et permet de mesurer les anomalies. Elle teste les sources, la proportion de données personnelles, les catégories sensibles, la qualité, la charge sur les sites, les demandes reçues et les performances. Le passage à l’échelle repose sur des critères de sortie écrits. L’absence d’incident pendant quelques jours ne vaut pas validation juridique.

Le dossier de conformité réunit enfin les décisions, non une accumulation de documents. Il comprend la fiche de traitement, la cartographie, la mise en balance, l’analyse de propriété intellectuelle, l’analyse d’impact si nécessaire, les contrats, les tests, les journaux et le plan de réponse. Chaque version est datée. Une entreprise doit pouvoir expliquer ce qu’elle a décidé avant le lancement et pourquoi.

À Paris et en Île-de-France, de nombreux projets associent une société éditrice, un prestataire technique, un hébergeur et des clients professionnels. La répartition des rôles doit être qualifiée pour chaque opération. Le cabinet peut intervenir avant le pilote, lors de la négociation d’une licence de données ou pour auditer un projet déjà déployé. La page consacrée au droit des affaires et aux contentieux des entreprises présente cet accompagnement.

B. Que faire après une mise en demeure pour scraping, une plainte ou un contrôle de la CNIL ?

La première mesure est de préserver les preuves sans poursuivre aveuglément la collecte. L’entreprise conserve le code, les versions, les journaux, les paramètres, les listes de sources, les conditions consultées, les données extraites, les contrats et les décisions internes. Elle empêche leur modification silencieuse. Cette conservation doit rester ciblée et sécurisée, car dupliquer le corpus contesté dans plusieurs environnements aggrave le risque.

La deuxième mesure est un arrêt proportionné. Si la contestation révèle un contournement, un accès authentifié inattendu, des données sensibles ou une extraction non prévue, la source concernée doit être suspendue immédiatement. Lorsque le litige porte sur le volume ou la licence, l’entreprise peut isoler le flux et geler sa réutilisation pendant l’analyse. Elle évite d’effacer précipitamment des preuves ou de continuer pour ne pas perdre un avantage commercial.

La mise en demeure doit être décomposée par fondement. Le demandeur invoque-t-il le RGPD, le droit du producteur de base, le droit d’auteur, le contrat, l’accès frauduleux, le parasitisme ou une atteinte au fonctionnement du site ? Chaque fondement appelle des faits et des preuves différents. Une réponse générale affirmant que les données étaient publiques ne traite aucun de ces régimes.

Sur le droit des bases, l’entreprise demande l’identification de la base, des investissements, de la partie extraite et des actes de réutilisation. Elle calcule ses propres volumes et fréquences. Elle distingue les données créées par l’éditeur de l’investissement dans la constitution ou la vérification de la base. Elle recherche une licence, une autorisation, une exception ou un usage normal. Si l’extraction est répétée, elle évalue l’effet cumulé.

Sur le RGPD, le responsable recense les personnes, les catégories, les finalités, les destinataires et la durée. Il vérifie l’information, les oppositions et les suppressions déjà demandées. Il examine si une violation de données personnelles s’est produite. La qualification d’une violation, son risque et l’éventuelle notification à la CNIL suivent un circuit distinct de la réponse au propriétaire du site.

Sur l’accès frauduleux, les journaux sont déterminants. Il faut savoir si le robot a rencontré un écran de connexion, une erreur d’autorisation, un captcha, un blocage d’adresse, une limitation de débit ou un répertoire non public. Les décisions de poursuivre, les changements de comptes et les mécanismes de contournement sont examinés. Une équipe ne doit pas réécrire a posteriori la finalité d’une rotation d’adresses ou d’une automatisation.

Sur le parasitisme, l’analyse porte sur la valeur économique et le profit prétendument capté. L’entreprise compare son propre investissement, ses sources multiples, ses transformations et sa valeur ajoutée. Une republication quasi immédiate, exhaustive et sans enrichissement est plus difficile à défendre qu’un résultat construit à partir de plusieurs sources avec une analyse autonome. La réponse doit rester factuelle et éviter les qualificatifs promotionnels.

Le préjudice allégué doit être contrôlé. Perte de trafic, charge serveur, coûts d’investigation, concurrence, baisse de conversion et dévalorisation de la base ne se confondent pas. Le demandeur doit établir le lien avec les actes reprochés. L’entreprise conserve ses statistiques et recherche les autres causes. Une discussion sur une licence ou une indemnité peut être utile, mais elle doit partir d’un périmètre vérifié.

Lorsque la CNIL intervient, la réponse suit le calendrier de la demande et décrit le traitement réel. Les équipes juridique, technique, sécurité et produit doivent partager la même chronologie. Les documents transmis sont recensés. Une mesure créée après le contrôle est présentée comme une remédiation, non comme une politique antérieure. Les questions auxquelles l’entreprise ne peut pas répondre immédiatement sont identifiées et instruites.

La remédiation peut prendre plusieurs formes : suppression d’une source, réduction des champs, filtrage des données sensibles, baisse de fréquence, arrêt d’un usage secondaire, nouvelle information, portail d’opposition, effacement de lots, renégociation du contrat ou licence. Chaque action reçoit un responsable, une échéance et une preuve de clôture. Une simple modification des conditions internes ne suffit pas si les données déjà collectées restent exploitées.

Les clients du service doivent être intégrés à la réponse. Si des données contestées leur ont été transmises, l’entreprise vérifie les clauses, les obligations d’information et la capacité de rappeler ou supprimer les lots. Elle évite une communication prématurée qui reconnaîtrait une faute non établie, mais ne dissimule pas un risque qui doit contractuellement être signalé. Les versions et destinataires sont tracés.

Une négociation avec l’éditeur peut organiser l’avenir. Elle définit les champs, la fréquence, le cache, l’attribution, les usages, la durée, les audits, les incidents et la rémunération. Une licence ne doit pas être limitée à une autorisation abstraite de scraper. Elle doit traiter la protection des données personnelles, les droits sur les contenus, les sous-traitants et les demandes des personnes.

Si une procédure contentieuse est engagée, le dossier technique doit pouvoir être compris par un juge. Les schémas, extraits de journaux, volumes, dates et règles de fonctionnement sont expliqués. Un constat peut être nécessaire pour figer une page, un blocage ou une condition. Les secrets d’affaires et les données personnelles sont protégés dans les échanges. La stratégie distingue les mesures urgentes, le fond et le quantum.

L’entreprise doit enfin décider si le projet reste viable. Une architecture fondée sur le contournement permanent, l’absence de provenance ou l’impossibilité d’exercer les droits n’est pas seulement risquée ; elle est fragile commercialement. Une source sous licence, une API, des données synthétiques, un partenariat ou une collecte directe peuvent offrir un produit plus durable. Le coût de mise en conformité doit être comparé au coût d’un arrêt brutal après déploiement.

Conclusion

Le web scraping n’est ni libre par principe ni interdit par nature. Sa licéité résulte d’une combinaison de règles. Le RGPD gouverne les données permettant d’identifier une personne. Le droit des bases protège certains investissements et peut viser les prélèvements substantiels comme les extractions répétées. Le contrat encadre l’accès. Le droit pénal sanctionne certains accès, maintiens ou traitements frauduleux. Le parasitisme protège une valeur économique individualisée contre la captation indue.

Les lignes directrices adoptées par le CEPD le 7 juillet 2026 rendent le contrôle plus concret pour l’IA générative. La finalité, l’intérêt légitime, la transparence, la minimisation, l’exactitude, la provenance et les données sensibles doivent être traités avant la collecte. Un robots.txt, un captcha ou une authentification ne résument pas le droit, mais ils constituent des signaux que l’entreprise ne peut ignorer.

Avant le lancement, la priorité est de cartographier les sources, limiter les champs, vérifier les licences, documenter la base légale, organiser les droits et conserver la provenance. Après une mise en demeure ou un contrôle, il faut suspendre les flux à risque, préserver les preuves, qualifier séparément chaque fondement et corriger sans réécrire la chronologie. Cette méthode permet de décider rapidement si le projet peut continuer, doit être licencié ou doit être abandonné.

Besoin d’un avis rapide sur votre dossier.

Le cabinet propose une consultation téléphonique sous 48 heures avec un avocat pour examiner un projet de web scraping, une licence de données, une mise en demeure ou un contrôle lié à l’IA. Vous pouvez appeler le 06 46 60 58 22 ou utiliser le formulaire de contact du cabinet Kohen Avocats. Le cabinet intervient à Paris et en Île-de-France, ainsi qu’à distance pour les entreprises et leurs prestataires.

Envoyez vos pièces. Recevez une stratégie.

Transmettez les pièces de votre dossier au cabinet. Maître Reda KOHEN vous répond personnellement sous 24 heures avec une première analyse stratégique.

Première analyse : 80 € TTC
Réponse personnelle sous 24 h
100 % confidentiel
Jusqu’à 1 Go de pièces

Source : Cour de cassation – Base Open Data « Judilibre » & « Légifrance ».