Cabinet Kohen Avocats · Paris

—

Maître Reda KOHEN intervient en droit immobilier, droit des sociétés et droit des affaires à Paris. Première analyse : 80 € TTC, réponse personnelle sous 24 heures.

100 % confidentiel · Secret professionnel · Sans engagement

Barreau de Paris Immobilier, sociétés, affaires Fiche CNB avocat.fr
Maître Reda KOHEN, avocat au Barreau de Paris
Maître Reda KOHEN
Avocat au Barreau de Paris

L’entraînement des modèles d’intelligence artificielle sur les contenus protégés de presse : analyse comparée des approches américaine et européenne du droit d’auteur face à l’exploitation algorithmique

L’entraînement des modèles d’intelligence artificielle sur les contenus protégés de presse : analyse comparée des approches américaine et européenne du droit d’auteur face à l’exploitation algorithmique

Le président du New York Times, Arthur Gregg Sulzberger, a prononcé le 1er juin 2026, au Congrès mondial des médias de la WAN-IFRA réuni à Marseille, un discours dont la vigueur traduit l’intensité des tensions qui traversent désormais l’économie de l’information. Il y a dénoncé le « vol sans scrupule de propriété intellectuelle » commis par les entreprises d’intelligence artificielle, accusant ces dernières de « piller les sites d’information sans autorisation ni compensation » et de menacer l’existence même du journalisme d’investigation. La plainte déposée par son journal contre OpenAI devant les juridictions fédérales américaines illustre, de manière emblématique, une ligne de fracture juridique majeure : celle qui oppose, de part et d’autre de l’Atlantique, les régimes de protection de la création intellectuelle confrontés au phénomène inédit de l’exploitation algorithmique de masse des contenus protégés.

Ce discours intervient dans un contexte de profonde incertitude législative. En France, la proposition de loi Darcos relative à l’instauration d’une présomption d’exploitation des contenus culturels par les systèmes d’intelligence artificielle, adoptée par le Sénat le 16 avril 2026, se trouve en ballottage à l’Assemblée nationale. Le 11 mai 2026, le journal Le Figaro titrait que le sort de ce texte « crucial pour le droit d’auteur » se jouait le lendemain. Depuis, le texte est sorti du calendrier parlementaire [[Décideurs-Juridiques, 17 mai 2026, https://www.decideurs-juridiques.com/regulation-juridiques/64372-presomption-d-usage-des-contenus-par-l-ia-la-proposition-de-loi-sort-du-calendrier-parlementaire.html.]]. Cette situation met en évidence une asymétrie fondamentale : alors que le contentieux américain progresse rapidement devant les juridictions fédérales, le Vieux Continent peine à dégager un cadre normatif stabilisé, oscillant entre la réaffirmation des principes traditionnels du droit d’auteur et la nécessité d’encourager l’innovation technologique.

L’objet de la présente analyse est de confronter les deux approches qui structurent actuellement le débat sur l’entraînement des modèles d’intelligence artificielle à partir de contenus de presse protégés. La première, américaine, repose sur la doctrine du fair use et se déploie essentiellement dans l’arène judiciaire. La seconde, européenne, combine l’exception obligatoire de fouille de textes et de données, le mécanisme d’opt-out, le droit voisin des éditeurs de presse et les obligations de transparence imposées par le règlement sur l’intelligence artificielle. La question qui se pose est de savoir dans quelle mesure ces deux architectures juridiques sont de nature à garantir une protection effective des contenus informationnels face à leur exploitation algorithmique.

I. Le contentieux américain : le fair use comme ligne de front du conflit entre éditeurs de presse et plateformes d’intelligence artificielle

A. L’action du New York Times contre OpenAI : une stratégie contentieuse fondée sur la violation directe du copyright

L’action introduite par le New York Times Company contre OpenAI Inc. et Microsoft Corporation devant le United States District Court for the Southern District of New York, le 27 décembre 2023, constitue le paradigme du contentieux émergent entre éditeurs de presse et développeurs de modèles de langage. La plainte articule plusieurs chefs de demande fondés sur le Copyright Act américain, au premier rang desquels figure la reproduction non autorisée de millions d’articles protégés à des fins d’entraînement des modèles GPT. L’originalité de l’argumentation du New York Times tient à sa démonstration d’une forme particulièrement insidieuse d’atteinte aux droits exclusifs : les modèles de langage, une fois entraînés sur le corpus du journal, ne se contentent pas de reproduire des fragments de textes mais sont en mesure de générer des réponses qui se substituent à la consultation des articles originaux, privant ainsi l’éditeur des revenus d’abonnement et de l’audience qui constituent son modèle économique.

La défense d’OpenAI s’articule autour de la doctrine du fair use, codifiée à la section 107 du Copyright Act de 1976. Celle-ci autorise l’utilisation d’oeuvres protégées sans autorisation de l’auteur à des fins de critique, de commentaire, d’enseignement, de recherche, dès lors que quatre facteurs sont satisfaits : la finalité et le caractère de l’utilisation, la nature de l’oeuvre protégée, la proportion de l’oeuvre utilisée et l’incidence de l’utilisation sur le marché potentiel de l’oeuvre. Or, le quatrième facteur, relatif à l’effet de substitution économique, constitue précisément la pierre angulaire de l’argumentation du New York Times. Celui-ci démontre, preuves techniques à l’appui, que les utilisateurs de ChatGPT obtiennent des résumés substantiels d’articles normalement accessibles derrière un paywall, contournant ainsi le modèle d’abonnement qui finance la production journalistique.

Cette stratégie contentieuse s’inscrit dans une évolution jurisprudentielle américaine marquée par une appréciation de plus en plus stricte du caractère transformatif de l’utilisation. La Cour suprême des États-Unis, dans son arrêt Andy Warhol Foundation for the Visual Arts, Inc. v. Goldsmith du 18 mai 2023, a significativement restreint la portée du premier facteur du fair use en jugeant qu’une oeuvre dérivée qui partage la même finalité commerciale que l’oeuvre originale ne saurait bénéficier de l’exception au seul motif qu’elle y ajoute une expression ou une signification nouvelle. Cette décision a directement fragilisé l’argumentaire des entreprises d’intelligence artificielle selon lequel l’entraînement de leurs modèles constituerait une utilisation transformative des contenus protégés, dès lors que les modèles entraînés se positionnent sur le même marché informationnel que les éditeurs dont ils exploitent les contenus.

B. La dimension extrajudiciaire du conflit : accords de licence et fragmentation du front des éditeurs

Parallèlement à la voie judiciaire, une pratique contractuelle s’est développée qui vient complexifier le paysage contentieux. Plusieurs grands éditeurs de presse, parmi lesquels le groupe Axel Springer, le Financial Times ou l’agence Associated Press, ont conclu des accords de licence avec OpenAI, autorisant l’utilisation de leurs contenus à des fins d’entraînement moyennant une rémunération dont les termes demeurent confidentiels. Ces accords traduisent une fragmentation du front des éditeurs qui affaiblit mécaniquement la position des tenants d’une approche exclusivement judiciaire. Le New York Times lui-même n’ignore pas cette dynamique : son président a reconnu, lors du congrès de Marseille, que « notre profession s’est montrée trop discrète, trop passive et trop fragmentée devant les abus commis par les entreprises qui provoquent la révolution de l’intelligence artificielle » [[Le Monde, 1er juin 2026, https://www.lemonde.fr/pixels/article/2026/06/01/un-vol-sans-scrupule-le-patron-du-new-york-times-accuse-les-entreprises-d-ia-de-piller-les-medias_6696007_4408996.html.]].

Cette fragmentation n’est pas uniquement conjoncturelle. Elle révèle une difficulté structurelle du droit de la propriété intellectuelle à appréhender des phénomènes d’exploitation de masse qui ne se prêtent pas au modèle traditionnel de la licence individuelle. Le droit d’auteur a été conçu pour régir des utilisations déterminées d’oeuvres identifiées par des utilisateurs nommés. L’entraînement d’un modèle de langage de grande dimension, qui suppose l’ingestion de milliards de documents provenant de millions de sources, rend illusoire l’idée d’un octroi préalable de licence pour chaque oeuvre exploitée. La chambre commerciale de la Cour de cassation a d’ailleurs eu l’occasion de rappeler la nécessité d’une interprétation du droit de la propriété intellectuelle qui prenne en considération les spécificités de l’économie numérique. Dans son arrêt du 6 mars 2024, elle a jugé, à propos de la qualification juridique du téléchargement d’un logiciel, que l’article L. 122-6, 3°, du code de la propriété intellectuelle doit être interprété en ce sens que « la mise à disposition d’une copie d’un logiciel par téléchargement et la conclusion d’un contrat de licence d’utilisation y afférente visant à rendre ladite copie utilisable par le client de manière permanente moyennant le paiement d’un prix implique le transfert du droit de propriété de cette copie » [[Cass. com., 6 mars 2024, n°22-23.657, Publié au Bulletin, https://www.courdecassation.fr/decision/65e81547a743ca0008c68c0f.]], se fondant sur la jurisprudence UsedSoft de la Cour de justice de l’Union européenne pour dépasser la qualification formelle de licence au profit d’une analyse économique de l’opération.

La Cour de justice de l’Union européenne, dans l’arrêt UsedSoft du 3 juillet 2012, avait précisément posé le principe selon lequel « la mise à disposition d’une copie d’un logiciel informatique, au moyen d’un téléchargement, et la conclusion d’un contrat de licence d’utilisation y afférent, visant à rendre ladite copie utilisable par les clients, de manière permanente, et moyennant le paiement d’un prix destiné à permettre au titulaire du droit d’auteur d’obtenir une rémunération correspondant à la valeur économique de la copie de l’oeuvre dont il est propriétaire, impliquent le transfert du droit de propriété de cette copie » [[CJUE, 3 juillet 2012, C-128/11, UsedSoft, https://curia.europa.eu/juris/liste.jsf?num=C-128/11.]]. Cette décision, qui consacre une approche économique de la qualification des opérations numériques, constitue un précédent important pour l’appréhension juridique des modèles d’affaires fondés sur l’exploitation algorithmique des contenus protégés. Elle invite le juge à dépasser les qualifications formelles pour appréhender la réalité économique des transactions numériques, une méthode d’analyse qui pourrait être transposée au contentieux de l’entraînement des modèles d’intelligence artificielle sur des corpus protégés.

II. L’architecture juridique européenne : l’exception de fouille de textes et de données face à l’impératif de protection des contenus informationnels

A. L’article L. 122-5-3 du code de la propriété intellectuelle et le mécanisme d’opt-out : un équilibre à l’épreuve de l’entraînement des modèles de langage

La directive (UE) 2019/790 du Parlement européen et du Conseil du 17 avril 2019 sur le droit d’auteur et les droits voisins dans le marché unique numérique a introduit, en ses articles 3 et 4, un régime à deux vitesses de l’exception de fouille de textes et de données. Le premier niveau, obligatoire pour les États membres, bénéficie aux organismes de recherche et institutions du patrimoine culturel à des fins de recherche scientifique. Le second niveau, facultatif, autorise toute personne à procéder à des fouilles de textes et de données, quelle que soit la finalité poursuivie, sous réserve que les titulaires de droits n’aient pas exprimé leur opposition de manière appropriée. Le législateur français a transposé cette architecture au paragraphe III de l’article L. 122-5-3 du code de la propriété intellectuelle, qui dispose que « des copies ou reproductions numériques d’oeuvres auxquelles il a été accédé de manière licite peuvent être réalisées en vue de fouilles de textes et de données menées à bien par toute personne, quelle que soit la finalité de la fouille, sauf si l’auteur s’y est opposé de manière appropriée, notamment par des procédés lisibles par machine pour les contenus mis à la disposition du public en ligne » [[Article L. 122-5-3 CPI, https://www.legifrance.gouv.fr/codes/article_lc/LEGIARTI000044363192.]].

Ce mécanisme d’opt-out, qui constitue la pièce maîtresse du dispositif européen, soulève plusieurs difficultés d’application lorsqu’il est confronté à l’entraînement des modèles d’intelligence artificielle à grande échelle. La première tient à l’effectivité de l’opposition : la notion de « procédés lisibles par machine » n’a fait l’objet d’aucune définition normative précise, laissant les acteurs économiques dans l’incertitude quant aux moyens techniques conformes. Le protocole robots.txt, conçu pour réguler l’exploration des sites web par les moteurs de recherche et dont l’extension TDMRep vise à l’adapter à la fouille de données, demeure une solution conventionnelle dépourvue de portée normative. La seconde difficulté concerne la charge de la preuve du respect de l’opt-out : dans un environnement où les données d’entraînement proviennent de collectes massives opérées par des robots d’indexation, il est techniquement malaisé pour un éditeur de démontrer qu’un modèle a été entraîné sur ses contenus malgré une opposition régulièrement exprimée.

La jurisprudence de la Cour de cassation fournit à cet égard un cadre d’analyse utile. L’arrêt du 15 octobre 2025, rendu par la chambre commerciale, a énoncé un principe dont la portée dépasse le seul contentieux du dénigrement : « en l’absence de décision de justice retenant l’existence d’actes de contrefaçon de droits d’auteur, le seul fait d’informer des tiers d’une possible contrefaçon de ces droits est constitutif d’un dénigrement des produits argués de contrefaçon » [[Cass. com., 15 octobre 2025, n°24-11.150, Publié au Bulletin, https://www.courdecassation.fr/decision/68ef380910fb86995ec6ea5c.]]. Cette décision, qui consacre une exigence de rigueur probatoire avant toute allégation d’atteinte à la propriété intellectuelle, rappelle que le droit d’auteur ne saurait être instrumentalisé comme un moyen de pression concurrentielle sans fondement judiciaire préalable. Elle invite, par analogie, à une grande prudence dans l’appréciation des preuves de l’exploitation algorithmique des contenus protégés.

Par ailleurs, l’articulation entre l’exception de fouille de textes et de données et le droit moral de l’auteur demeure une question largement inexplorée. L’article L. 121-1 du code de la propriété intellectuelle reconnaît à l’auteur un droit au respect de son nom, de sa qualité et de son oeuvre. Or, l’entraînement d’un modèle d’intelligence artificielle sur des textes journalistiques, sans attribution de la source ni mention du nom de l’auteur, porte une atteinte potentielle au droit à la paternité qui n’est pas couverte par l’exception de fouille de textes et de données. La chambre commerciale a également rappelé, dans son arrêt du 26 mars 2025 relatif à l’affaire opposant Meta Platforms à la société Cargo Media, que « l’action en contrefaçon et l’action en concurrence déloyale peuvent être exercées simultanément à titre principal dès lors que se trouve caractérisée au soutien de l’action en concurrence déloyale l’existence d’une faute relevant de faits distincts de ceux retenus au titre de la contrefaçon » [[Cass. com., 26 mars 2025, n°23-13.589, Publié au Bulletin, https://www.courdecassation.fr/decision/67e3a405dfcf522ee2c324f2.]], précisant qu’un même acte matériel peut caractériser des faits distincts s’il porte atteinte à des droits de nature différente.

B. Le droit voisin des éditeurs de presse et le règlement européen sur l’intelligence artificielle : la construction d’une protection à plusieurs niveaux

L’article 15 de la directive (UE) 2019/790 a institué, au profit des éditeurs de presse établis dans un État membre, un droit voisin sur leurs publications de presse en ce qui concerne l’utilisation en ligne de ces publications par les fournisseurs de services de la société de l’information. Ce droit, transposé en droit français aux articles L. 218-1 et suivants du code de la propriété intellectuelle, confère aux éditeurs le droit d’autoriser ou d’interdire la reproduction et la communication au public de leurs publications par les plateformes numériques. La Cour de justice de l’Union européenne, dans son arrêt du 27 mars 2024, a jugé que ce droit s’applique aux extraits de publications de presse diffusés sur les interfaces des moteurs de recherche et des réseaux sociaux, sans qu’il soit nécessaire de démontrer que la totalité de l’article a été reproduite. Cette jurisprudence, si elle ne vise pas directement l’entraînement des modèles d’intelligence artificielle, consacre une approche extensive du droit voisin qui pourrait utilement être invoquée par les éditeurs souhaitant s’opposer à l’exploitation de leurs contenus à des fins algorithmiques.

Le règlement (UE) 2024/1689 du 13 juin 2024 établissant des règles harmonisées concernant l’intelligence artificielle, dit AI Act, ajoute une couche supplémentaire à cet édifice normatif. Son article 53 impose aux fournisseurs de modèles d’IA à usage général l’obligation de « mettre à la disposition du public un résumé suffisamment détaillé des contenus utilisés pour l’entraînement du modèle » [[Règlement (UE) 2024/1689, art. 53, https://eur-lex.europa.eu/legal-content/FR/TXT/?uri=CELEX:32024R1689.]]. Cette obligation de transparence, dont les modalités d’application doivent être précisées par le Bureau de l’IA de la Commission européenne, constitue un levier procédural potentiellement décisif pour les éditeurs de presse : elle leur permettra, pour la première fois, d’identifier les contenus qui ont effectivement servi à l’entraînement d’un modèle et, le cas échéant, d’établir la preuve de l’exploitation non autorisée de leurs publications. La mise en oeuvre effective de cette obligation demeure toutefois suspendue à l’adoption par la Commission des lignes directrices et des modèles de déclaration prévus par le règlement, dont la publication est attendue pour le troisième trimestre 2026.

La Cour de justice de l’Union européenne a posé, dans une série d’arrêts rendus entre 2009 et 2021, les jalons d’une interprétation finaliste du droit d’auteur dans l’environnement numérique. Dans l’arrêt Infopaq International du 16 juillet 2009, elle a jugé que « les différents éléments de l’oeuvre que sont les mots sont protégés pour autant qu’ils constituent l’expression de la création intellectuelle propre à leur auteur » [[CJUE, 16 juillet 2009, C-5/08, Infopaq International, https://curia.europa.eu/juris/liste.jsf?num=C-5/08.]], consacrant ainsi une conception exigeante de l’originalité qui exclut de la protection les simples données factuelles. Cette jurisprudence a été confirmée et précisée par l’arrêt Cofemel du 12 septembre 2019, aux termes duquel « la notion d’oeuvre implique nécessairement un objet identifiable avec suffisamment de précision et d’objectivité », étant précisé que « cette exigence d’identification précise et objective ne saurait être remplie lorsque ce qui est invoqué est essentiellement une sensation, qui est, par nature, subjective » [[CJUE, 12 septembre 2019, C-683/17, Cofemel, https://curia.europa.eu/juris/liste.jsf?num=C-683/17.]]. Ces principes excluent des prérogatives du droit d’auteur les articles de presse qui se borneraient à rapporter des faits sans y apporter l’empreinte de la personnalité de leur auteur, une distinction qui est au coeur du contentieux de l’entraînement algorithmique.

Dans l’arrêt GS Media du 8 septembre 2016, la Cour de justice a jugé que « l’exploitant d’un site internet qui propose des hyperliens vers des oeuvres protégées librement disponibles sur un autre site internet effectue un acte de communication au public lorsque ce site a été réalisé sans l’autorisation du titulaire du droit d’auteur et que ledit exploitant avait connaissance du caractère illicite de la publication de ces oeuvres sur cet autre site » [[CJUE, 8 septembre 2016, C-160/15, GS Media, https://curia.europa.eu/juris/liste.jsf?num=C-160/15.]]. Cette construction prétorienne de la connaissance comme critère de la communication au public pourrait, par analogie, fonder une exigence de vérification préalable de la licéité des sources par les entreprises qui entraînent leurs modèles sur des corpus de contenus protégés. Dans l’arrêt YouTube/Cyando du 22 juin 2021, elle a précisé l’étendue de la responsabilité des plateformes pour les contenus protégés communiqués au public par leurs utilisateurs, en distinguant selon que l’opérateur a joué un rôle actif lui conférant une connaissance ou un contrôle des contenus en cause. Ces principes, bien qu’ils n’aient pas été spécifiquement formulés pour le contentieux de l’intelligence artificielle, fournissent un cadre d’interprétation qui devra être mobilisé lorsque les juridictions de l’Union seront saisies des premières affaires relatives à l’entraînement algorithmique.

Le contentieux de la concurrence déloyale et du parasitisme économique apporte une dimension complémentaire à la protection des éditeurs de presse. Le droit commun de la responsabilité civile, fondé sur l’article 1240 du code civil, permet la sanction des comportements par lesquels un opérateur économique tire profit, sans contrepartie, des investissements réalisés par autrui. La chambre commerciale de la Cour de cassation, dans la construction jurisprudentielle qu’elle élabore depuis plusieurs décennies, a progressivement affiné les critères de l’action en parasitisme et son articulation avec les actions fondées sur des droits privatifs de propriété intellectuelle. La difficulté, en matière d’entraînement algorithmique, réside dans la qualification d’une faute distincte de la simple exploitation non autorisée de contenus protégés, condition exigée pour le cumul des actions que la chambre commerciale a rappelée avec une particulière netteté dans son arrêt du 26 mars 2025 précité.

Conclusion

La confrontation des approches américaine et européenne de l’entraînement des modèles d’intelligence artificielle sur les contenus de presse protégés révèle une divergence de méthode plus qu’une divergence de finalité. Le système américain, fidèle à sa tradition de common law, privilégie la résolution judiciaire des conflits par l’application de standards jurisprudentiels souples, au premier rang desquels figure la doctrine du fair use. Le système européen, caractéristique de la tradition continentale, s’efforce de réguler ex ante par la combinaison d’exceptions légales, de droits voisins et d’obligations de transparence. Ces deux approches présentent des lacunes symétriques : l’approche américaine fait peser sur les éditeurs la charge d’un contentieux long et coûteux dont l’issue dépend d’une appréciation casuistique des facteurs du fair use ; l’approche européenne, en dépit de l’arsenal normatif qu’elle déploie, souffre d’un défaut d’effectivité du mécanisme d’opt-out et d’une absence de définition normative des standards techniques permettant son exercice.

La proposition de loi Darcos, en instaurant une présomption d’exploitation des contenus culturels par les systèmes d’intelligence artificielle, visait à renverser la charge de la preuve et à pallier l’asymétrie informationnelle dont souffrent les éditeurs face aux plateformes. Son retrait du calendrier parlementaire, dans un contexte d’opposition affichée par les acteurs français de l’intelligence artificielle, témoigne des tensions qui traversent la construction d’un droit de la propriété intellectuelle adapté à l’économie algorithmique. L’avenir de cette régulation se jouera à l’articulation de plusieurs fronts : l’évolution du contentieux américain, dont l’issue influencera l’équilibre des négociations contractuelles entre éditeurs et plateformes ; la mise en oeuvre des obligations de transparence imposées par le règlement européen sur l’intelligence artificielle, qui fournira aux éditeurs les moyens probatoires de faire valoir leurs droits ; et la capacité du législateur français à dégager, au-delà des clivages partisans, un consensus sur la protection des contenus informationnels qui ne sacrifie ni la création journalistique ni l’innovation technologique.

Envoyez vos pièces. Recevez une stratégie.

Transmettez les pièces de votre dossier au cabinet. Maître Reda KOHEN vous répond personnellement sous 24 heures avec une première analyse stratégique.

Première analyse : 80 € TTC
Réponse personnelle sous 24 h
100 % confidentiel
Jusqu’à 1 Go de pièces

Source : Cour de cassation – Base Open Data « Judilibre » & « Légifrance ».