La révélation, au début du mois d’août 2026, du « Projet Panama » a placé la numérisation massive des œuvres littéraires au centre de l’actualité du droit de la propriété intellectuelle. Selon les documents judiciaires rapportés par la presse généraliste, la société Anthropic aurait, entre 2024 et 2026, acheté et scanné plusieurs millions de livres afin de constituer des corpus destinés à l’entraînement de ses modèles d’intelligence artificielle, parfois en détruisant les exemplaires physiques après numérisation. Le Parisien, dans son édition du 8 août 2026, a qualifié ce programme de « projet fou de l’IA pour numériser et détruire tous les livres du monde », tandis que des auteurs américains ont engagé une action en contrefaçon contre l’entreprise californienne. Cette affaire interroge directement le droit français, qui soumet la reproduction des œuvres de l’esprit à l’autorisation préalable de leurs auteurs et n’admet la fouille de textes et de données que dans des conditions strictement encadrées.
La question posée n’est pas nouvelle, mais elle atteint une ampleur inédite : les corpus d’entraînement des grands modèles de langage absorbent des volumes d’œuvres protégées sans contrepartie contractuelle, et le contentieux national s’organise autour de la contrefaçon de droit d’auteur, des droits voisins de la presse et du droit sui generis des producteurs de bases de données. La jurisprudence récente, rendue entre 2023 et 2026 par la chambre commerciale de la Cour de cassation, les cours d’appel de Paris et le tribunal judiciaire de Paris, offre un cadre d’analyse cohérent pour apprécier la licéité de telles collectes. Il apparaît nécessaire d’examiner successivement la qualification juridique de la numérisation massive des œuvres au regard du monopole de l’auteur (I), puis les protections complémentaires et les remèdes procéduraux mobilisables par les titulaires de droits (II).
I. La numérisation massive des œuvres à des fins d’entraînement et le monopole de l’auteur
Le droit d’auteur confère à l’auteur d’une œuvre de l’esprit un droit de propriété incorporelle exclusif dont la reproduction non autorisée constitue une contrefaçon. La numérisation de livres entiers, intégrés ensuite à des corpus d’entraînement, entre dans le champ de ce monopole, sous réserve des exceptions légales d’application stricte. Il convient de préciser les contours du droit exclusif de reproduction (A), avant d’examiner la portée de l’exception de fouille de textes et de données, seule voie de licéité potentielle (B).
A. La reproduction non autorisée des œuvres littéraires, un acte de contrefaçon
L’article L. 111-1 du code de la propriété intellectuelle dispose que l’auteur d’une œuvre de l’esprit jouit sur cette œuvre, du seul fait de sa création, d’un droit de propriété incorporelle exclusif et opposable à tous, comportant des attributs d’ordre intellectuel et moral ainsi que des attributs d’ordre patrimonial. La jurisprudence applique ce principe avec constance à toutes les formes d’expression, y compris les écrits littéraires dont la reproduction numérique opère la fixation matérielle.
En vertu de l’article L. 122-4 du code de la propriété intellectuelle, toute représentation ou reproduction intégrale ou partielle faite sans le consentement de l’auteur ou de ses ayants droit ou ayants cause est illicite, de même que la traduction, l’adaptation ou la transformation, l’arrangement ou la reproduction par un art ou un procédé quelconque. La numérisation d’un ouvrage, qui consiste en la fixation matérielle de son contenu sous forme numérique, constitue donc un acte de reproduction au sens de ces dispositions, quelle que soit la finalité poursuivie par l’opérateur.
Le tribunal judiciaire de Paris a récemment rappelé la rigueur de ce régime dans un jugement du 14 janvier 2026 (RG n° 24/14914), en retenant que « la bonne foi est indifférente en matière de contrefaçon de droits d’auteur » et que l’originalité d’une œuvre résulte « des choix libres et créatifs de son auteur, en ce sens qu’elle porte l’empreinte de sa personnalité, et n’est pas la banale reprise d’un fonds commun non appropriable » (TJ Paris, 3e ch. 3e sect., 14 janvier 2026, RG n° 24/14914, Prépa Up et un auteur c/ M. K.). Dans cette affaire, la diffusion en ligne de résumés d’œuvres classiques, dont l’auteur avait cédé ses droits à une société d’édition, a été sanctionnée comme contrefaçon des droits patrimoniaux de reproduction et de représentation, la circonstance que les fichiers aient été transmis par un tiers ou payés étant jugée inopérante.
Cette décision présente un intérêt direct pour l’économie de l’entraînement des modèles d’intelligence artificielle. Elle enseigne que le défaut d’autorisation du titulaire des droits suffit à caractériser la contrefaçon, indépendamment de la bonne foi de celui qui exploite l’œuvre, de l’acquisition prétendument licite du support et du versement d’un prix à un intermédiaire. La reprise de contenus protégés au sein de corpus numériques, quand bien même elle s’opérerait à partir d’exemplaires achetés sur le marché de l’occasion ou obtenus auprès de tiers, ne saurait donc être exonérée au seul motif de la licéité de la source matérielle.
La protection du droit moral renforce encore le dispositif, ainsi que l’illustre un jugement du 23 mai 2025 du tribunal judiciaire de Paris (RG n° 22/06102), rendu dans le contentieux opposant un auteur à un éditeur au sujet de la reprise d’une préface dans une réédition du « Précis de Foutriquet ». Le tribunal a jugé que « la reprise littérale de ce texte dans la préface de Monsieur [H.], sans l’autorisation de l’auteur, constitue une contrefaçon du droit d’auteur », avant de retenir l’atteinte au droit de divulgation pour la publication d’un extrait en dépit de l’opposition clairement exprimée de son auteur (TJ Paris, 3e ch. 2e sect., 23 mai 2025, RG n° 22/06102, M. C. c/ M. H. et la société Les Provinciales). La mise en balance avec la liberté d’expression garantie par l’article 10 de la Convention de sauvegarde des droits de l’homme et des libertés fondamentales n’a pas fait obstacle à la condamnation, l’ingérence étant jugée proportionnée au but légitime de protection du droit de propriété intellectuelle.
La reproduction d’une œuvre protégée à des fins d’entraînement d’un modèle d’intelligence artificielle n’échappe à ce monopole que si elle entre dans le champ d’une exception légale, les exceptions étant, en droit d’auteur, d’interprétation stricte. La démonstration vaut tant pour les ouvrages littéraires que pour les photographies et autres contenus graphiques, ainsi que l’a rappelé le tribunal judiciaire de Marseille dans un jugement du 12 mai 2025 (RG n° 25/00050), qui a retenu la contrefaçon commise par la reprise d’une photographie de l’Agence France-Presse, l’utilisateur ayant « indûment bénéficié des efforts commerciaux, humains et financiers » de l’agence (TJ Marseille, 1re ch., 12 mai 2025, RG n° 25/00050, AFP c/ société YLEA Entreprise).
B. L’exception de fouille de textes et de données, une licéité conditionnelle et révocable
L’article L. 122-5 du code de la propriété intellectuelle énumère les exceptions au monopole de l’auteur, parmi lesquelles figurent, au 10°, « les copies ou reproductions numériques d’une œuvre en vue de la fouille de textes et de données réalisée dans les conditions prévues à l’article L. 122-5-3 ». Ce mécanisme, issu de la transposition de l’article 4 de la directive (UE) 2019/790 du 17 avril 2019, constitue la seule voie par laquelle un opérateur commercial peut utiliser des œuvres protégées pour entraîner un modèle d’intelligence artificielle sans autorisation préalable.
L’article L. 122-5-3 du code de la propriété intellectuelle définit la fouille de textes et de données comme « la mise en œuvre d’une technique d’analyse automatisée de textes et données sous forme numérique afin d’en dégager des informations, notamment des constantes, des tendances et des corrélations ». Le I de ce texte soumet la réalisation de copies ou reproductions numériques à deux conditions cumulatives : un accès licite aux œuvres et une opposition non exprimée de l’auteur. Des lors, le téléchargement d’ouvrages depuis des bibliothèques clandestines en ligne, dont l’illicéité est notoire, ne saurait constituer un accès licite au sens de ces dispositions.
Le mécanisme de réservation, dit d’opt-out, joue un rôle central dans l’architecture du texte. Le III de l’article L. 122-5-3 précise que des copies ou reproductions numériques peuvent être réalisées « en vue de fouilles de textes et de données menées à bien par toute personne, quelle que soit la finalité de la fouille, sauf si l’auteur s’y est opposé de manière appropriée, notamment par des procédés lisibles par machine pour les contenus mis à la disposition du public en ligne ». Les copies et reproductions doivent en outre être stockées avec un niveau de sécurité approprié puis détruites à l’issue de la fouille, ce qui contredit frontalement la constitution de corpus persistants destinés à alimenter durablement des modèles génératifs.
L’application de ce régime à la numérisation massive pratiquée dans le cadre du « Projet Panama » appelle trois observations. En premier lieu, l’acquisition d’exemplaires physiques par l’intermédiaire d’opérateurs tiers ne fait pas disparaître la nécessité de l’autorisation de l’auteur pour la reproduction numérique intégrale de l’œuvre, la cession des droits patrimoniaux ne se présumant pas. En deuxième lieu, la destruction des exemplaires après numérisation, rapportée par la presse, méconnaît l’exigence de conservation temporaire et sécurisée des copies, conçues pour être détruites à l’issue de la fouille et non pour la constitution d’archives pérennes.
En troisième lieu, la jurisprudence rappelle que ces exceptions, d’interprétation stricte, ne peuvent être étendues au-delà de leur lettre, et que leur bénéfice est réservé aux actes qui satisfont l’intégralité des conditions qu’elles énoncent. Le tribunal judiciaire de Paris a ainsi jugé, dans le litige opposant la société Copie France à un opérateur de télévision au sujet de la fonctionnalité d’enregistrement différé, que « la reproduction réalisée par la fonctionnalité du « Time shifting » satisfaisant l’ensemble des conditions de l’exception de copie transitoire de l’article L.122-5, 6° du code de la propriété intellectuelle, elle ne relève pas du droit de reproduction de l’article L.122-5, 2° qu’indemnise la redevance de copie privée » (TJ Paris, 3e ch. 1re sect., 7 mai 2026, RG n° 22/08444, Copie France c/ société SFR). Cette décision confirme que l’application d’une exception suppose la réunion cumulative de toutes les conditions légales, ce qui exclut la transposition par analogie du mécanisme de la copie transitoire à la constitution de corpus d’entraînement destinés à être conservés et exploités durablement.
L’ensemble de ces éléments conduit à considérer que la numérisation massive d’œuvres littéraires sans autorisation des auteurs, fût-elle opérée à partir d’exemplaires physiques acquis auprès de tiers, constitue en droit français un acte de contrefaçon au sens de l’article L. 122-4 du code de la propriété intellectuelle. La seule voie de licéité résiderait dans la démonstration d’un accès licite aux œuvres et de l’absence d’opposition de leurs auteurs, conditions que la collecte organisée à grande échelle ne satisfait manifestement pas.
II. Les protections complémentaires des producteurs de contenus et les remèdes procéduraux
Les éditeurs de presse et les producteurs de bases de données disposent, au-delà du droit d’auteur, de droits propres que la jurisprudence récente a mobilisés avec efficacité contre les collectes massives de contenus en ligne. Ces protections complémentaires, d’origine européenne, ont été transposées dans le code de la propriété intellectuelle et donnent lieu à un contentieux nourri (A). Elles s’accompagnent de mesures procédurales spécifiques, de la saisie-contrefaçon au blocage des sites, dont la mise en œuvre conditionne l’effectivité des droits (B).
A. Les droits voisins de la presse et le droit sui generis des producteurs de bases de données
L’article L. 218-1 du code de la propriété intellectuelle définit la publication de presse comme une collection composée principalement d’œuvres littéraires de nature journalistique, constituant une unité au sein d’une publication périodique portant un titre unique, publiée à l’initiative, sous la responsabilité éditoriale et sous le contrôle des éditeurs de presse ou d’une agence de presse. Le droit voisin ainsi institué requiert l’autorisation de l’éditeur ou de l’agence avant toute reproduction ou communication au public de ses publications sous forme numérique par un service de communication au public en ligne.
La cour d’appel de Paris a eu l’occasion de préciser la portée de ces droits dans un arrêt du 25 septembre 2025 (RG n° 24/17260), rendu dans le contentieux opposant l’Agence France-Presse à la société X Internet Unlimited Company. Confirmant l’ordonnance de référé, la cour a jugé que la société X était tenue, en sa qualité de service de communication au public en ligne, de fournir à l’AFP tous les éléments d’information relatifs aux utilisations de ses publications de presse par les usagers de la plateforme, au titre de l’article L. 218-4 du code de la propriété intellectuelle (CA Paris, pôle 1, ch. 2, 25 septembre 2025, RG n° 24/17260, AFP c/ société X Internet Unlimited Company). La cour a écarté la thèse selon laquelle l’adhésion de l’AFP aux conditions générales d’utilisation de la plateforme vaudrait licence gratuite, en relevant que « le droit voisin a précisément été instauré pour contraindre les plateformes à rémunérer les agences et éditeurs de presse au titre de l’utilisation de leurs contenus ».
La portée de cette jurisprudence est considérable pour les opérateurs d’intelligence artificielle qui entraînent leurs modèles sur les contenus de presse. Elle établit que l’obligation de transparence et de communication des données d’utilisation pèse sur les plateformes indépendamment des conditions contractuelles qu’elles imposent, et que l’usage des contenus de presse à des fins d’entraînement ne saurait être assimilé à l’usage licite des « mots isolés ou de très courts extraits » protégé par l’article L. 211-3-1 du même code.
Le tribunal judiciaire de Paris a confirmé cette orientation dans une décision du 19 février 2026 (RG n° 24/14353), rendue dans le litige opposant plusieurs dizaines d’éditeurs de presse aux sociétés Microsoft au titre de l’entraînement de leurs modèles d’intelligence artificielle. Le juge de la mise en état a rejeté la demande de sursis à statuer fondée sur l’existence de questions préjudicielles pendantes devant la Cour de justice de l’Union européenne, jugeant que l’issue des procédures C-797/23 et C-663/24 était « dépourvue d’incidence directe sur la solution du présent litige », avant de condamner les sociétés Microsoft à verser 15 000 euros pour procédure abusive (TJ Paris, 3e ch. 1re sect., 19 février 2026, RG n° 24/14353, éditeurs de presse c/ sociétés Microsoft). Cette décision, qui renvoie l’affaire au fond, marque une étape décisive dans le contentieux français des droits voisins face aux modèles génératifs.
Les producteurs de bases de données bénéficient, pour leur part, d’un droit sui generis qui leur permet d’interdire l’extraction et la réutilisation de la totalité ou d’une partie substantielle du contenu de leurs bases. L’article L. 341-1 du code de la propriété intellectuelle subordonne cette protection à la démonstration d’un investissement financier, matériel ou humain substantiel dans la constitution, la vérification ou la présentation du contenu. L’article L. 342-1 du même code définit l’extraction comme le transfert permanent ou temporaire de la totalité ou d’une partie substantielle du contenu sur un autre support, par tout moyen et sous toute forme que ce soit.
La chambre commerciale de la Cour de cassation, par un arrêt du 15 octobre 2025 (pourvoi n° 23-23.167), a précisé les conditions de mise en œuvre de ce droit dans le contentieux opposant le Groupe La Centrale à la société ADS4ALL, éditrice du site Le Parking. Rejetant le pourvoi, la Cour a approuvé les juges du fond d’avoir retenu que le site litigieux « transférait les données composant les annonces issues de La Centrale sur son propre support », caractérisant ainsi des actes d’extraction d’une partie substantielle du contenu de la base protégée, « l’appropriation massive des données étant ainsi de nature à remettre en cause les investissements humains, techniques et financiers substantiels consentis par cette société pour l’obtention, la vérification ou la présentation du contenu de sa base de données » (Cass. com., 15 octobre 2025, pourvoi n° 23-23.167, société Groupe La Centrale c/ société ADS4ALL).
Le tribunal judiciaire de Paris avait antérieurement fait application de ces principes dans un jugement du 17 octobre 2024 (RG n° 21/09145), condamnant la société Am Data et ses associés à verser 40 000 euros à la société Sales Factory Data pour avoir réutilisé une partie substantielle de sa base de données BMA. Le tribunal a relevé que la société défenderesse « a réutilisé, au point de la reconstituer, une partie substantielle de la base de données « BMA » de la société Sales Factory Data », la preuve de la contrefaçon résultant notamment de la reprise d’adresses pièges et de la comparaison opérée par l’expert judiciaire (TJ Paris, 3e ch. 1re sect., 17 octobre 2024, RG n° 21/09145, Sales Factory Data c/ Am Data et autres). La technique des données pièges, dont l’efficacité probatoire est ici consacrée, constitue un outil précieux pour les titulaires de droits confrontés à l’extraction massive de leurs corpus.
B. La saisie-contrefaçon, le blocage des sites et la preuve de l’extraction massive
La preuve de la contrefaçon commise à l’occasion de l’entraînement de modèles d’intelligence artificielle soulève des difficultés spécifiques, tenant à la masse des données collectées et à l’opacité des opérations de collecte. Le régime de la saisie-contrefaçon, prévu aux articles L. 332-1 et suivants du code de la propriété intellectuelle, permet au titulaire de droits, sur autorisation du juge, de faire procéder à la description détaillée ou à la saisie réelle des éléments prétendument contrefaisants. La jurisprudence récente en a rappelé le caractère fondamental, tout en sanctionnant les irrégularités affectant sa mise en œuvre.
Le tribunal judiciaire de Paris, dans un jugement du 7 mai 2025 (RG n° 23/06108), a ainsi annulé un procès-verbal de saisie-contrefaçon dressé dans le cadre d’un litige portant sur des logiciels, tout en rappelant que « quiconque a qualité pour agir en contrefaçon est en droit de faire procéder en tout lieu et par tous huissiers, le cas échéant assistés d’experts désignés par le demandeur, en vertu d’une ordonnance rendue sur requête par la juridiction civile compétente, soit à la description détaillée, soit à la saisie réelle du logiciel ou de la base de données prétendument contrefaits » (TJ Paris, 3e ch. 3e sect., 7 mai 2025, RG n° 23/06108, Areas Consulting c/ société Xybim et autres). Cette décision souligne l’équilibre recherché entre l’effectivité du droit de la preuve et la protection des droits de la défense.
La cour d’appel de Paris a, par ailleurs, admis la validité des assignations fondées sur des saisies-contrefaçon portant sur des masses de contenus non individualisées, dans son arrêt du 6 octobre 2023 (RG n° 22/15239) rendu dans le contentieux opposant la société Digimind aux sociétés Les Echos, Le Parisien Libéré et Société du Figaro. La cour a jugé que « la circonstance que les articles indexés ne soient pas tous identifiés est insuffisante pour considérer que l’assignation est nulle, les actes reprochés portant sur le fonctionnement de la plateforme ci-avant rappelé qui rend très difficile voire impossible d’identifier l’ensemble des articles collectés » (CA Paris, pôle 5, ch. 2, 6 octobre 2023, RG n° 22/15239, société Digimind c/ sociétés Les Echos, Le Parisien Libéré et Société du Figaro). Cette solution, transposable aux corpus d’entraînement, écarte l’exigence d’une identification exhaustive des œuvres contrefaites lorsque l’atteinte résulte du fonctionnement même d’un dispositif de collecte automatisé.
La procédure accélérée au fond offre aux titulaires de droits un second levier, celui du blocage des services en ligne qui portent atteinte à leurs droits. L’article L. 336-2 du code de la propriété intellectuelle permet au président du tribunal judiciaire d’ordonner toutes mesures propres à prévenir ou à faire cesser une atteinte à un droit d’auteur ou à un droit voisin occasionnée par le contenu d’un service de communication au public en ligne. Le tribunal judiciaire de Paris a fait application de ce dispositif dans un jugement du 7 mai 2025 (RG n° 25/02294), ordonnant aux fournisseurs d’accès à internet de bloquer l’accès au site dayfr.com, dont le caractère entièrement ou quasi entièrement illicite était établi par les constats de commissaire de justice (TJ Paris, 3e ch. 3e sect., 7 mai 2025, RG n° 25/02294, Alliance de la presse d’information générale et autres c/ sociétés Orange, SFR, Free et Bouygues Telecom). Le tribunal a retenu que « l’atteinte aux droits d’auteur et aux droits voisins est constituée » au vu de la reproduction d’articles de presse sur le site litigieux, nonobstant les légères modifications apportées aux contenus.
La dimension pénale n’est pas absente du dispositif, ainsi que le montre la question transmise pour avis à la chambre criminelle par la chambre commerciale de la Cour de cassation dans un arrêt du 26 mars 2025 (pourvoi n° 23-12.479). Saisie d’un litige relatif à l’envoi répété et concerté de messages visant à modifier les résultats naturels d’un moteur de recherche, la chambre commerciale a interrogé la chambre criminelle sur le point de savoir « si un moteur de recherches constitue un système de traitement automatisé de données au sens des articles 323-2 et 323-7 du code pénal » et si les agissements modifiant les résultats naturels sont illicites (Cass. com., 26 mars 2025, pourvoi n° 23-12.479, société Iso Set c/ société Reddit Inc.). L’intérêt de cette question pour la collecte automatisée de données à grande échelle, dont relève la numérisation de corpus littéraires, est manifeste : la qualification de système de traitement automatisé de données étendrait le champ de la répression pénale aux techniques de collecte intrusive.
L’effectivité des droits des auteurs et des producteurs de contenus dépend enfin des actions en responsabilité fondées sur la concurrence déloyale et le parasitisme, lorsque la contrefaçon ne peut être établie ou en complément de celle-ci. Les entreprises victimes de l’appropriation de leurs investissements doivent alors identifier une valeur économique individualisée et démontrer que l’opérateur s’est placé dans leur sillage pour tirer indûment profit de leurs efforts, ainsi que le rappelle la jurisprudence constante de la chambre commerciale. Un accompagnement par un avocat en concurrence déloyale et en parasitisme à Paris permet d’apprécier la stratégie contentieuse la plus adaptée à chaque situation, en fonction de la nature des droits atteints et de l’étendue des preuves mobilisables.
Conclusion
Le « Projet Panama » révélé au début du mois d’août 2026 offre une illustration saisissante des tensions qui traversent le droit de la propriété intellectuelle à l’ère des modèles génératifs. La numérisation massive d’œuvres littéraires sans autorisation de leurs auteurs constitue, au regard des principes posés par les articles L. 111-1 et L. 122-4 du code de la propriété intellectuelle, un acte de contrefaçon dont l’exception de fouille de textes et de données ne saurait exonérer l’opérateur, faute d’accès licite aux œuvres et de respect des conditions de l’opt-out. Les droits voisins des éditeurs de presse et le droit sui generis des producteurs de bases de données complètent le dispositif, comme l’illustrent les décisions récentes rendues à l’encontre des plateformes et des opérateurs d’intelligence artificielle.
La jurisprudence des années 2023 à 2026 témoigne d’une montée en puissance des remèdes procéduraux : la saisie-contrefaçon, dont les irrégularités sont sanctionnées sans en affaiblir la fonction probatoire, le blocage des services en ligne ordonné sur le fondement de l’article L. 336-2 du code de la propriété intellectuelle, et l’extension, en cours d’examen, des qualifications pénales aux systèmes de traitement automatisé de données. Les titulaires de droits disposent ainsi d’un arsenal complet pour défendre leurs corpus face aux collectes massives opérées à des fins d’entraînement. Des lors, l’issue des contentieux en cours, en France comme devant la Cour de justice de l’Union européenne, dessinera les contours d’un équilibre entre la protection des créateurs et le développement des technologies d’intelligence artificielle, dont la régulation ne saurait se réduire à une simple question d’efficacité technique.
Transmettez les pièces de votre dossier au cabinet. Maître Reda KOHEN vous répond personnellement sous 24 heures avec une première analyse stratégique.