La violation des droits d’auteur par les systèmes d’intelligence artificielle générative : l’action des éditeurs Hachette contre Google du 15 juillet 2026 à l’épreuve de l’exception de fouille de textes et de données
I. La protection des œuvres littéraires face à l’exploitation par les systèmes d’intelligence artificielle générative
A. La titularité des droits d’auteur des éditeurs et l’étendue du monopole de reproduction
L’article L. 111-1 du code de la propriété intellectuelle énonce que « l’auteur d’une oeuvre de l’esprit jouit sur cette oeuvre, du seul fait de sa création, d’un droit de propriété incorporelle exclusif et opposable à tous ». Ce principe cardinal du droit d’auteur français, à la fois personnel et patrimonial, constitue le fondement de l’action intentée le 15 juillet 2026 par plusieurs maisons d’édition, au premier rang desquelles le groupe Hachette, contre la société Google devant les juridictions américaines. La plainte, déposée devant la United States District Court for the Southern District of New York, reproche au géant technologique d’avoir « secrètement copié des millions d’œuvres » protégées par le droit d’auteur afin d’entraîner son modèle d’intelligence artificielle générative Gemini. Cette action judiciaire s’inscrit dans une série de contentieux transnationaux — de l’action du New York Times contre OpenAI à celle du Syndicat national de l’édition contre Meta — qui interrogent les limites de l’exploitation des œuvres protégées à des fins d’apprentissage automatique.
Or, dans le système juridique français, l’article L. 122-4 du même code dispose que « toute représentation ou reproduction intégrale ou partielle faite sans le consentement de l’auteur ou de ses ayants droit ou ayants cause est illicite. Il en est de même pour la traduction, l’adaptation ou la transformation, l’arrangement ou la reproduction par un art ou un procédé quelconque ». La généralité de la formule — « par un art ou un procédé quelconque » — offre un champ d’application particulièrement étendu, susceptible d’englober la reproduction numérique aux fins de constitution de corpus d’entraînement pour les modèles d’intelligence artificielle. En conséquence, toute extraction massive de contenus éditoriaux protégés, fût-elle réalisée par des procédés automatisés de crawling ou de scraping à l’échelle du web, tombe potentiellement sous le coup de cette prohibition, sauf à démontrer que l’opérateur bénéficie d’une exception légalement prévue.
La chambre commerciale de la Cour de cassation a rappelé, par un arrêt du 15 octobre 2025, que l’existence d’un droit privatif constitue un préalable indispensable à l’action en contrefaçon, mais que le seul fait d’informer des tiers d’une possible contrefaçon de droits d’auteur, en l’absence de décision de justice la retenant, « est constitutif d’un dénigrement des produits argués de contrefaçon » (Com., 15 octobre 2025, n° 24-11.150, Publié au Bulletin). Par ailleurs, le tribunal judiciaire de Paris, dans une décision du 7 mai 2026, a rappelé que « les exceptions énumérées par le présent article ne peuvent porter atteinte à l’exploitation normale de l’oeuvre ni causer un préjudice injustifié aux intérêts légitimes de l’auteur » (TJ Paris, 7 mai 2026, n° 22/08444), consacrant ainsi le principe du test des trois étapes issu de la directive 2001/29/CE du 22 mai 2001 sur l’harmonisation de certains aspects du droit d’auteur et des droits voisins dans la société de l’information.
Dès lors, la question centrale posée par le contentieux Hachette/Google réside dans la détermination du point d’équilibre entre, d’une part, la protection pleine et entière du droit exclusif de reproduction des éditeurs sur les œuvres de leur catalogue et, d’autre part, la légitimité des opérations techniques d’extraction et d’analyse de données textuelles à grande échelle qui constituent le socle du développement des systèmes d’intelligence artificielle. Cette tension n’est pas inédite : elle prolonge, dans un contexte technologique renouvelé, les interrogations qui avaient déjà surgi à l’occasion du programme Google Books, lequel avait donné lieu à un contentieux fleuve aux États-Unis, finalement tranché par la Cour suprême en 2016 au bénéfice de Google sur le fondement du fair use. À cet égard, le contentieux de juillet 2026 se distingue radicalement du précédent Google Books en ce qu’il ne porte plus sur la simple numérisation et l’indexation d’extraits à des fins de consultation publique, mais sur l’absorption intégrale des contenus éditoriaux dans les corpus d’entraînement de modèles génératifs capables de produire des contenus substituables aux œuvres originales. Cette mutation de l’exploitation — de la consultation à la génération — modifie profondément l’analyse juridique au regard du test des trois étapes et du critère de l’exploitation normale de l’œuvre.
B. L’exception de fouille de textes et de données et ses limites face à l’entraînement des modèles d’intelligence artificielle générative
L’article L. 122-5-3 du code de la propriété intellectuelle, issu de la transposition de la directive européenne 2019/790 du 17 avril 2019 sur le droit d’auteur et les droits voisins dans le marché unique numérique, institue une exception spécifique au droit exclusif de reproduction : celle de la fouille de textes et de données (TDM, pour Text and Data Mining). Ce texte définit la fouille de textes et de données comme « la mise en œuvre d’une technique d’analyse automatisée de textes et données sous forme numérique afin d’en dégager des informations, notamment des constantes, des tendances et des corrélations ». L’architecture de cette exception repose sur une distinction fondamentale entre deux régimes : un régime restreint, réservé aux organismes de recherche, aux bibliothèques et aux institutions patrimoniales agissant à des fins de recherche scientifique (paragraphe II), et un régime général, ouvert à « toute personne, quelle que soit la finalité de la fouille » (paragraphe III), mais assorti d’un droit d’opposition reconnu aux titulaires de droits.
En conséquence, l’opérateur privé qui entend procéder à des fouilles de textes et de données à des fins commerciales — ce qui est incontestablement le cas de Google lorsqu’il constitue les corpus d’entraînement de son modèle Gemini — ne peut se prévaloir du régime dérogatoire du paragraphe II et doit donc se placer sous l’empire du paragraphe III. Or, ce paragraphe III subordonne la licéité de la fouille à deux conditions cumulatives. D’une part, les copies ou reproductions numériques doivent avoir été réalisées à partir d’œuvres « auxquelles il a été accédé de manière licite ». D’autre part, l’auteur ne doit pas s’y être opposé « de manière appropriée, notamment par des procédés lisibles par machine pour les contenus mis à la disposition du public en ligne ». Cette double condition — accès licite d’un côté, absence d’opposition de l’autre — constitue le verrou juridique sur lequel les éditeurs entendent fonder leur action contre Google. En effet, la question de savoir si l’extraction massive de contenus éditoriaux par des robots d’indexation, sans autorisation préalable des titulaires de droits et sans que ceux-ci aient pu matériellement exercer leur droit d’opposition, satisfait à l’exigence de l’accès licite est au cœur du litige engagé le 15 juillet 2026.
Par ailleurs, la directive 2019/790 elle-même, en son considérant 18, précise que l’exception de fouille de textes et de données ne saurait s’appliquer lorsque les titulaires de droits ont expressément réservé leurs droits « de manière appropriée, par exemple au moyen de procédés lisibles par machine pour les contenus mis à la disposition du public en ligne ». Or, la mise en œuvre effective de ce mécanisme d’opt-out soulève des difficultés pratiques considérables. Les éditeurs, dont les catalogues sont composés d’œuvres publiées sur des supports physiques et numériques diversifiés — livres imprimés, fichiers ePub, contenus diffusés sur des plateformes tierces — se trouvent dans l’incapacité matérielle de déployer des protocoles d’exclusion automatisés à l’échelle de l’ensemble de leur fonds éditorial. À cet égard, la Commission européenne a engagé, le 9 juillet 2026, une consultation publique sur l’élaboration d’un standard technique interopérable pour l’exercice du droit d’opposition à la fouille de textes et de données, reconnaissant implicitement l’insuffisance des mécanismes actuels de réservation des droits. Dès lors, l’effectivité du droit d’opposition reconnu par l’article L. 122-5-3, III, du code de la propriété intellectuelle est sérieusement compromise, ce qui pourrait conduire le juge à considérer que l’exception de fouille de textes et de données ne saurait bénéficier à un opérateur qui s’est affranchi de toute diligence pour s’assurer de l’absence d’opposition des titulaires de droits.
II. Le contentieux Hachette/Google du 15 juillet 2026 et la construction prétorienne de l’action en contrefaçon de droits d’auteur
A. La caractérisation de la contrefaçon de droits d’auteur à l’ère de l’intelligence artificielle générative
L’assignation délivrée le 15 juillet 2026 par le groupe Hachette, conjointement avec les éditeurs HarperCollins, Penguin Random House, Simon & Schuster, Macmillan et l’Academic Press d’Elsevier, articule le grief de contrefaçon autour d’une double démonstration : celle, d’abord, de l’existence d’actes matériels de reproduction non autorisée d’œuvres protégées, constitués par le téléchargement et la copie des contenus éditoriaux dans les serveurs de Google aux fins d’entraînement de Gemini ; celle, ensuite, de l’absence d’exception légalement applicable à ces actes, compte tenu de la finalité commerciale de l’opération et de l’exercice par les éditeurs de leur droit d’opposition à la fouille de textes et de données. La plainte allègue que Google a procédé au « scraping » systématique de bases de données éditoriales, de librairies en ligne et de plateformes de diffusion numérique, en violation des conditions générales d’utilisation de ces services et en contournant les mesures techniques de protection mises en place par les éditeurs.
Or, en droit français, la caractérisation de la contrefaçon de droits d’auteur n’exige pas la démonstration d’un élément intentionnel : l’atteinte au droit exclusif de reproduction est constituée par le seul fait matériel de la reproduction non autorisée, indépendamment de la bonne ou mauvaise foi du contrefacteur. La chambre commerciale de la Cour de cassation a rappelé, par un arrêt du 31 janvier 2024, que la protection conférée par l’enregistrement s’acquiert au profit du créateur ou de son ayant cause et que « l’auteur de la demande d’enregistrement est, sauf preuve contraire, regardé comme le bénéficiaire de cette protection » (Com., 31 janvier 2024, n° 22-20.409, Publié au Bulletin). En conséquence, la titularité des droits d’auteur sur les œuvres du catalogue Hachette, établie par les contrats d’édition conclus avec les auteurs, fonde la qualité à agir des éditeurs en contrefaçon, sans qu’il soit nécessaire de rapporter une preuve supplémentaire de l’originalité de chaque œuvre individuelle, celle-ci se présumant du seul fait de la création et de la divulgation sous le nom des auteurs.
Par ailleurs, le contentieux soulève une difficulté probatoire inédite tenant à l’opacité des systèmes d’entraînement des modèles d’intelligence artificielle. L’éditeur qui allègue la contrefaçon doit rapporter la preuve que ses œuvres ont effectivement été reproduites dans le corpus d’entraînement du modèle incriminé, preuve dont la charge lui incombe en vertu de l’article 1353 du code civil. Or, l’accès aux données d’entraînement de Gemini est protégé par le secret des affaires, et les techniques de rétro-ingénierie permettant de détecter la mémorisation d’œuvres dans les paramètres d’un modèle — dites techniques d’extraction de connaissances (knowledge extraction attacks) — demeurent à l’état expérimental. La CJUE, dans son arrêt du 21 octobre 2010, a jugé que « un lien est nécessaire entre l’application de la redevance destinée à financer la compensation équitable (…) et l’usage présumé de ces derniers à des fins de reproduction privée » (CJUE, 21 octobre 2010, Padawan, C-467/08), posant ainsi le principe d’un rattachement causal entre l’acte de reproduction et son imputabilité à un opérateur déterminé. Dès lors, l’aménagement de la charge de la preuve, voire l’instauration d’une présomption de reproduction des œuvres accessibles en ligne lorsque l’opérateur ne divulgue pas la composition de son corpus d’entraînement, constitue un enjeu procédural déterminant pour l’issue du contentieux.
Enfin, la chambre commerciale de la Cour de cassation a jugé, par un arrêt du 18 mars 2026, que « lorsqu’elles reposent sur les mêmes faits, une action en contrefaçon et une action en concurrence déloyale ou fondée sur le parasitisme tendent aux mêmes fins, à savoir l’interdiction de fabrication et de commercialisation d’un produit ou d’un service et la réparation du préjudice subi du fait de cette commercialisation » (Com., 18 mars 2026, n° 24-17.016, Publié au Bulletin). Par ailleurs, dans le même arrêt, la Cour a précisé que le parasitisme économique « consiste, pour un opérateur économique, à se placer dans le sillage d’un autre afin de tirer indûment profit de ses efforts, de son savoir-faire, de la notoriété acquise ou des investissements consentis » (Com., 18 mars 2026, n° 24-17.016, précité). Cette construction prétorienne ouvre aux éditeurs la possibilité de cumuler l’action en contrefaçon de droits d’auteur avec une action en parasitisme, à la condition de caractériser des faits distincts de ceux invoqués au soutien de la contrefaçon. En l’espèce, le parasitisme pourrait être caractérisé par l’exploitation, sans contrepartie, des investissements éditoriaux consentis par Hachette et les autres éditeurs pour constituer, sélectionner et valoriser leur catalogue d’œuvres, ces investissements ayant été détournés par Google pour améliorer les performances de son modèle génératif et en tirer un avantage concurrentiel.
B. L’articulation procédurale de l’action en contrefaçon et la réparation du préjudice à l’échelle internationale
Le contentieux Hachette/Google, bien qu’engagé devant les juridictions américaines, soulève des questions de droit international privé qui intéressent directement l’ordre juridique français. L’article L. 122-5-3, III, du code de la propriété intellectuelle autorise toute personne à procéder à des fouilles de textes et de données « quelle que soit la finalité de la fouille, sauf si l’auteur s’y est opposé de manière appropriée, notamment par des procédés lisibles par machine pour les contenus mis à la disposition du public en ligne ». Cette disposition, qui transpose le considérant 18 de la directive 2019/790, pose une exigence de moyen — l’opposition doit être « appropriée » — dont l’appréciation relève du pouvoir souverain des juges du fond. Or, la question de savoir si l’insertion d’une clause de réservation des droits dans les conditions générales d’utilisation d’une plateforme de diffusion, ou dans les métadonnées d’un fichier numérique, constitue une opposition « appropriée » au sens de ce texte n’a pas encore été tranchée par la Cour de cassation. Le contentieux Hachette/Google pourrait ainsi contribuer, par un effet de convergence normative, à préciser les obligations de diligence qui pèsent sur les opérateurs d’intelligence artificielle en amont de la constitution de leurs corpus d’entraînement.
En conséquence, l’appréciation du caractère « approprié » de l’opposition des titulaires de droits doit être mise en perspective avec le principe de proportionnalité, dont la chambre commerciale de la Cour de cassation a fait une application renouvelée en matière de propriété intellectuelle. Dans un arrêt du 18 mars 2026, la Cour a en effet jugé que la partie qui a introduit une action en contrefaçon rejetée pour défaut de droit privatif est désormais recevable à former, pour la première fois en appel, une demande fondée sur le parasitisme (Com., 18 mars 2026, n° 24-17.016, précité, § 12). Par ailleurs, la Cour de cassation a rappelé, dans son arrêt du 5 mars 2025, que « le parasitisme résulte d’un ensemble d’éléments appréhendés dans leur globalité, indépendamment de tout risque de confusion » et que « les idées étant de libre parcours, le seul fait de reprendre, en le déclinant, un concept mis en œuvre par un concurrent ne constitue pas, en soi, un acte de parasitisme » (Com., 5 mars 2025, n° 23-21.157, Publié au Bulletin, § 5 et 7). Ces principes, transposés au contentieux de l’intelligence artificielle, invitent le juge à distinguer soigneusement entre la reprise légitime d’un concept générique — l’entraînement de modèles de langage sur des corpus textuels — et la captation indue de la valeur économique créée par les éditeurs au moyen de leurs investissements éditoriaux.
À cet égard, le tribunal judiciaire de Paris, dans sa décision du 7 mai 2026, a procédé à une analyse minutieuse de l’articulation entre l’exception de copie provisoire transitoire de l’article L. 122-5, 6°, et celle de copie privée de l’article L. 122-5, 2°, en jugeant que « la reproduction réalisée par la fonctionnalité du « Time shifting » satisfaisant l’ensemble des conditions de l’exception de copie transitoire (…) elle ne relève pas du droit de reproduction de l’article L.122-5, 2° qu’indemnise la redevance de copie privée » (TJ Paris, 7 mai 2026, n° 22/08444). Cette décision illustre la méthode d’analyse que les juridictions françaises appliquent aux exceptions au droit d’auteur : une interprétation stricte des conditions de chaque exception, combinée à une vérification de la conformité au test des trois étapes. Dès lors, le juge saisi du contentieux Hachette/Google, qu’il soit américain ou, par extension, français dans le cadre d’une éventuelle action devant les juridictions nationales, devra examiner si l’exception de fouille de textes et de données peut couvrir des actes de reproduction massifs d’œuvres protégées réalisés sans vérification préalable de l’existence d’une opposition des titulaires de droits.
La réparation du préjudice subi par les éditeurs constitue enfin un enjeu considérable du contentieux. L’article L. 122-6 du code de la propriété intellectuelle, qui sanctionne la contrefaçon de droits d’auteur, doit être combiné avec l’article 1240 du code civil, fondement de la responsabilité civile extracontractuelle, pour permettre aux éditeurs d’obtenir non seulement la cessation des actes illicites mais également l’indemnisation intégrale de leur préjudice. Or, l’évaluation du préjudice économique résultant de l’utilisation non autorisée d’œuvres éditoriales pour l’entraînement d’un modèle d’IA générative soulève des difficultés méthodologiques inédites : comment évaluer la part de la valeur ajoutée par un modèle d’IA attribuable à une œuvre spécifique, noyée dans un corpus de plusieurs millions de textes ? À cet égard, la publication par Google, le 30 juin 2026, de ses résultats financiers trimestriels faisant état d’une croissance de 28 % des revenus publicitaires liés aux produits d’IA, dont Gemini, fournit aux éditeurs un premier élément d’assiette pour le calcul du préjudice. En toute hypothèse, le juge disposera d’un large pouvoir d’appréciation pour fixer le montant des dommages et intérêts, conformément à la jurisprudence constante de la Cour de cassation selon laquelle les juges du fond apprécient souverainement l’étendue du préjudice.
Conclusion
Le contentieux engagé le 15 juillet 2026 par le groupe Hachette et plusieurs éditeurs majeurs contre Google pour violation des droits d’auteur par l’entraînement du modèle Gemini constitue, à bien des égards, un litige fondateur pour l’encadrement juridique de l’intelligence artificielle générative. En soumettant à l’examen du juge la licéité de l’extraction massive d’œuvres protégées à des fins d’apprentissage automatique, cette action contraint les juridictions à tracer la frontière entre l’exception de fouille de textes et de données, consacrée par la directive 2019/790 et transposée à l’article L. 122-5-3 du code de la propriété intellectuelle, et l’atteinte au droit exclusif de reproduction des auteurs et éditeurs. La solution qui sera dégagée, qu’elle intervienne aux États-Unis ou, par capillarité normative, dans l’ordre juridique européen, déterminera pour les années à venir le point d’équilibre entre la protection de la création intellectuelle et le développement de l’innovation technologique.
Transmettez les pièces de votre dossier au cabinet. Maître Reda KOHEN vous répond personnellement sous 24 heures avec une première analyse stratégique.