Cabinet Kohen Avocats · Paris

—

Maître Reda KOHEN intervient en droit immobilier, droit des sociétés et droit des affaires à Paris. Première analyse : 80 € TTC, réponse personnelle sous 24 heures.

100 % confidentiel · Secret professionnel · Sans engagement

Barreau de Paris Immobilier, sociétés, affaires Fiche CNB avocat.fr
Maître Reda KOHEN, avocat au Barreau de Paris
Maître Reda KOHEN
Avocat au Barreau de Paris

L’intelligence artificielle et la contrefaçon de droit d’auteur : entraînement des modèles, exception de fouille et présomption légale d’exploitation

Le déploiement industriel des modèles d’intelligence artificielle générative bouleverse les fondements classiques du droit de la propriété littéraire et artistique. Pour acquérir leurs capacités de compréhension et de génération textuelle, visuelle ou musicale, les grands modèles de langage et les réseaux de neurones profonds nécessitent l’ingestion préalable de volumes colossaux de données numérisées. Dans cette phase d’entraînement, des millions d’œuvres protégées par le droit d’auteur sont collectées de manière automatisée sur le réseau Internet, reproduites sur des serveurs de calcul intensif, découpées en unités élémentaires de traitement vectoriel et intégrées dans l’architecture probabiliste des paramètres algorithmiques. Cette extraction massive, opérée le plus souvent sans l’autorisation préalable des créateurs ni versement de la moindre contrepartie financière, soulève un contentieux sériel d’une ampleur inédite devant les juridictions civiles et commerciales.

L’actualité judiciaire française illustre avec acuité la tension grandissante entre les géants technologiques et les industries de la création. Devant la troisième chambre du tribunal judiciaire de Paris, le Syndicat national de l’édition, la Société des gens de lettres et le Syndicat national des auteurs et des compositeurs ont engagé une action contentieuse d’envergure contre la société Meta, accusée d’avoir exploité de manière illicite un corpus de près de deux cent mille livres, notamment issu de la base Books3, pour entraîner sa famille de modèles Llama. Les plaignants réclament la constatation d’actes de contrefaçon de droits d’auteur et sollicitent, au-delà de l’indemnisation de leurs préjudices, une injonction d’éviction ordonnant la suppression des jeux de données d’entraînement litigieux ainsi que la cessation de l’exploitation des systèmes qui en sont dérivés. Cette affaire emblématique, analysée dans les publications spécialisées telles que Tech Insider, met en lumière le gouffre technique et probatoire auquel se heurtent traditionnellement les créateurs face à l’opacité des pipelines de développement de l’intelligence artificielle.

Face à ce constat de carence, les pouvoirs publics et les institutions ont engagé une refonte substantielle des règles probatoires. Le 8 avril 2026, le Sénat a adopté à l’unanimité, sur le rapport législatif de la commission de la culture, une proposition de loi novatrice créant une présomption légale d’exploitation des contenus culturels par les fournisseurs de modèles d’intelligence artificielle. Ce texte, désormais enregistré sous le numéro 2634 à l’Assemblée nationale et validé sur le plan constitutionnel par le Conseil d’État dans son avis du 19 mars 2026, répond à une asymétrie informationnelle devenue insoutenable pour les titulaires de droits. En parallèle, les obligations de transparence issues du règlement européen sur l’intelligence artificielle, entrées en application le 2 août 2026 pour les modèles à usage général, imposent la publication de résumés détaillés des corpus d’entraînement. Comme le souligne l’Agence du patrimoine immatériel de l’État dans ses analyses relatives à l’intelligence artificielle générative et le droit d’auteur, le centre de gravité des litiges se déplace de la simple qualification des productions générées vers la traçabilité intégrale des données d’entrée.

Cette mutation profonde invite à examiner successivement les mécanismes juridiques qui gouvernent la qualification de contrefaçon et le traitement des exceptions légales lors de l’entraînement des modèles, avant d’analyser les voies procédurales, les mesures d’instruction et les sanctions civiles qui permettent aux entreprises et aux créateurs de défendre efficacement leurs actifs incorporels face aux acteurs de l’intelligence artificielle.

I. L’asymétrie probatoire et la qualification de contrefaçon dans l’entraînement des modèles d’intelligence artificielle

La confrontation entre le droit d’auteur et les technologies d’apprentissage automatique impose de qualifier juridiquement chaque étape technique du cycle de vie des données, depuis leur moissonnage initial jusqu’à leur incorporation dans les pondérations d’un modèle pré-entraîné. Cette analyse requiert d’éprouver la consistance du droit exclusif de reproduction face aux exceptions textuelles, tout en mesurant les obstacles probatoires inhérents à la nature computationnelle des réseaux neuronaux.

Dans cette perspective, les entreprises confrontées à des utilisations non autorisées de leurs catalogues doivent mobiliser les concepts fondamentaux du Code de la propriété intellectuelle et s’appuyer sur des stratégies de contentieux commercial rigoureusement articulées.

A. L’acte de reproduction numérique et les limites de l’exception de fouille de textes et de données

Le socle de la protection accordée par le droit d’auteur repose sur le principe cardinal énoncé à l’article L. 111-1 du Code de la propriété intellectuelle, aux termes duquel l’auteur d’une œuvre de l’esprit jouit sur cette création, du seul fait de sa conception, d’un droit de propriété incorporelle exclusif et opposable à tous. Ce monopole confère à son titulaire des prérogatives morales et patrimoniales destinées à interdire ou autoriser toute forme d’exploitation économique. À cet égard, l’article L. 122-4 du Code de la propriété intellectuelle dispose que toute représentation ou reproduction intégrale ou partielle faite sans le consentement de l’auteur ou de ses ayants droit ou ayants cause est illicite, de même que la traduction, l’adaptation ou la transformation de l’œuvre par un procédé quelconque.

Sur le plan jurisprudentiel, la juridiction d’appel rappelle avec constance la portée absolue de cette règle prohibitive. Ainsi, dans son arrêt rendu le 23 janvier 2026, la Cour d’appel de Paris a réaffirmé la teneur textuelle du principe en soulignant que « Toute représentation ou reproduction intégrale ou partielle faite sans le consentement de l’auteur ou de ses ayants droit ou ayants cause est illicite. Il en est de même pour la traduction, l’adaptation ou la transformation, l’arrangement ou la reproduction par un art ou un procédé quelconque. » Cette qualification d’acte de reproduction s’applique pleinement aux opérations matérielles indispensables à l’entraînement d’une intelligence artificielle. Pour être analysée par un algorithme, l’œuvre doit être téléchargée, numérisée, convertie en jetons textuels ou en représentations matricielles, puis dupliquée dans les mémoires vives et les clusters de stockage des serveurs de calcul. Chacune de ces étapes constitue une fixation matérielle directe au sens du droit d’auteur, engageant la responsabilité de son auteur en l’absence d’habilitation conventionnelle ou d’exemption légale.

Pour tenter d’échapper au grief de contrefaçon, les développeurs de modèles d’intelligence artificielle invoquent fréquemment le bénéfice des exceptions de fouille de textes et de données introduites en droit européen par la directive 2019/790 du 17 avril 2019 sur le droit d’auteur dans le marché unique numérique. Transposée en droit interne à l’article L. 122-5-3 du Code de la propriété intellectuelle, cette disposition permet, sous certaines conditions, la reproduction et l’extraction numériques d’œuvres accessibles de façon licite à des fins d’analyse automatisée de données. Toutefois, l’application de ce régime dérogatoire à l’entraînement de modèles génératifs commerciaux se heurte à des limites juridiques strictes que la pratique contractuelle et contentieuse ne peut ignorer.

D’une part, l’exception générale prévue au paragraphe III de l’article L. 122-5-3 est expressément subordonnée à l’absence d’opposition des titulaires de droits. Ces derniers disposent de la faculté légale de formuler une clause de réserve, couramment désignée sous le terme de clause de retrait ou d’opt-out, exprimée notamment au moyen de procédés lisibles par machine pour les contenus mis à la disposition du public en ligne. Or, dans les faits, de nombreux fournisseurs de technologies procèdent à des aspirations globales sans respecter les balises d’exclusion technique, ou moissonnent des corpus compilés en violation manifeste des droits d’origine, à l’instar de bases constituées à partir de réseaux non autorisés. D’autre part, la finalité même de la fouille de données, initialement conçue pour l’extraction de connaissances corrélationnelles et statistiques, ne saurait être détournée pour justifier l’incorporation pérenne de la valeur expressive des œuvres au sein d’un outil destiné à générer des contenus concurrents sur le marché.

La protection du droit d’auteur suppose en outre que l’œuvre revendiquée remplisse la condition fondamentale d’originalité. Dans son arrêt rendu le 9 avril 2026, la Première chambre civile de la Cour de cassation a précisé la grille d’analyse applicable en retenant que « pour être protégée par le droit d’auteur, une oeuvre des arts appliqués doit résulter d’un effort créatif portant l’empreinte de la personnalité de son auteur lui conférant le caractère d’oeuvre originale ». La Cour suprême a également souligné que « Même lorsque son auteur a effectué des choix qui ne sont pas dictés par des contraintes techniques ou autres, le caractère créatif de ces choix, au sens du droit d’auteur, ne saurait être présumé. » Cette exigence probatoire, qui impose d’apprécier la combinaison des éléments originaux dans leur ensemble, trouve un écho direct dans la jurisprudence de la Cour de justice de l’Union européenne, notamment issue des arrêts Cofemel et Brompton, selon lesquels l’effort ou l’investissement financier ne sauraient suppléer l’absence de choix libres et créatifs.

B. L’opacité algorithmique et le renversement de la charge de la preuve par la présomption légale

Dans le schéma classique du procès civil régi par le droit commun de la preuve, la charge de démontrer l’acte matériel de contrefaçon incombe intégralement au demandeur. En matière de propriété littéraire et artistique, l’auteur ou l’ayant droit doit identifier précisément l’œuvre contrefaite et établir que le défendeur a procédé à une reproduction ou à une représentation non autorisée de celle-ci. Si cette démonstration ne présente pas de difficulté insurmontable lorsqu’un produit physique ou un fichier contrefaisant est directement mis en circulation, elle devient quasiment impossible dans l’environnement opaque des architectures d’intelligence artificielle.

Une fois la phase d’apprentissage achevée, les données textuelles ou iconographiques ayant servi à l’entraînement ne sont pas conservées sous leur forme brute au sein du modèle final. Elles sont déconstruites et dissoutes dans des milliards de paramètres numériques, sous forme de poids synaptiques et de matrices probabilistes. À moins d’obtenir du modèle une restitution littérale et flagrante d’un passage protégé, phénomène technique connu sous le nom de mémorisation ou de régurgitation algorithmique, l’auteur ne dispose d’aucun moyen technique externe pour vérifier si son manuscrit, son article de presse ou son illustration graphique a été ingéré par le réseau de neurones. Cette asymétrie informationnelle structurelle paralysait jusqu’alors l’exercice effectif des voies de droit.

Pour restaurer l’équilibre procédural entre les créateurs et les entreprises de technologie, les travaux parlementaires ont abouti à l’adoption d’un mécanisme de facilitation probatoire décisif. Le rapport législatif n° 496 déposé au Sénat documente l’adoption unanime, le 8 avril 2026, de la proposition de loi instaurant une présomption légale d’exploitation des contenus culturels par les fournisseurs d’intelligence artificielle. Le dispositif législatif pose une règle procédurale claire : dès lors qu’un titulaire de droits présente un ensemble d’indices crédibles rendant vraisemblable l’utilisation de son œuvre lors de la conception, du développement ou du déploiement d’un système d’intelligence artificielle, l’exploitation non autorisée est présumée acquise dans le cadre de l’instance civile.

Ces indices de vraisemblance peuvent être constitués par des analyses stylistiques comparatives, des similarités formelles ou structurelles récurrentes dans les résultats générés, des éléments tangibles relatifs à la composition des jeux de données publiquement admis par le fournisseur, ou encore des rapports d’audit technique documentant les sources web moissonnées. Dès l’instant où ce faisceau concordant est soumis aux débats judiciaires, la charge de la preuve bascule sur le fournisseur d’intelligence artificielle. Il appartient dès lors à ce dernier, qui détient seul la maîtrise de ses pipelines d’ingestion et de ses journaux de traitement, de rapporter la preuve contraire.

Cette preuve libératoire impose au développeur du modèle de produire des éléments positifs et vérifiables : soit en démontrant par la traçabilité de ses registres techniques que l’œuvre en cause n’a jamais figuré dans les corpus d’apprentissage, soit en établissant qu’elle a été exploitée sur le fondement d’une licence contractuelle valide ou dans le respect rigoureux des conditions de l’exception de fouille de textes et de données, notamment quant au respect des oppositions régulières formulées par les titulaires. En conférant à cette présomption un caractère réfragable conforme aux exigences constitutionnelles et européennes, le législateur offre aux acteurs culturels un levier déterminant pour contraindre les concepteurs de modèles à la négociation de protocoles de licence et au respect scrupuleux des droits de propriété intellectuelle.

II. La mise en œuvre contentieuse et l’articulation des sanctions civiles face aux fournisseurs d’intelligence artificielle

L’engagement d’une action en contrefaçon contre un fournisseur de modèle d’intelligence artificielle requiert une stratégie contentieuse méthodique. De la constitution préalable des preuves matérielles à la liquidation des préjudices financiers et moraux, les titulaires de droits doivent coordonner les instruments procéduraux du Code de la propriété intellectuelle avec les nouvelles exigences de conformité issues du droit de l’Union européenne.

Dans ce contexte hautement technique, les entreprises du secteur de la création comme les acteurs du numérique doivent structurer leurs démarches autour de mécanismes contractuels solides et recourir aux règles gouvernant les contrats commerciaux ainsi que la prévention du parasitisme économique.

A. Les mesures d’instruction probatoires et la saisie-contrefaçon appliquées aux environnements numériques

Préalablement à toute assignation au fond, la constitution d’un dossier probatoire étayé conditionne le succès de l’action en justice. En matière de propriété littéraire et artistique, les modes de preuve sont gouvernés par le principe de liberté probatoire consacré par la jurisprudence judiciaire. Dans un arrêt de principe rendu le 7 juillet 2021, la Chambre commerciale de la Cour de cassation a formellement énoncé que « la contrefaçon de logiciel peut être prouvée par tout moyen. Il en résulte qu’elle peut notamment l’être par des captures d’écran de sites internet, lesquelles ne sont pas dépourvues par nature de force probante. »

Cette solution jurisprudentielle trouve une application immédiate dans le contentieux de l’intelligence artificielle. Les constatations d’huissier de justice dressées sur des interfaces de programmation, les enregistrements de sessions de requêtes et de réponses générées par les modèles, ainsi que les extractions de métadonnées constituent des éléments probatoires recevables pour caractériser la matérialité des faits litigieux. Toutefois, face à des algorithmes complexes dont l’infrastructure logicielle et les jeux de données demeurent hébergés sur des serveurs distants ou privés, les simples constats en ligne s’avèrent parfois insuffisants pour appréhender l’ensemble de la chaîne de contrefaçon.

C’est pourquoi les titulaires de droits peuvent solliciter sur requête, auprès du président du tribunal judiciaire territorialement compétent, des mesures d’instruction in futurum sur le fondement de l’article 145 du Code de procédure civile ou diligenter une procédure de saisie-contrefaçon conformément aux dispositions de l’article L. 332-1 du Code de la propriété intellectuelle. Cette mesure d’instruction exorbitante du droit commun permet à un commissaire de justice, souvent assisté d’un expert indépendant en informatique et en science des données, de se présenter dans les locaux du fournisseur ou de ses prestataires d’hébergement pour procéder à la description détaillée ou à la copie physique de tout document, registre de moissonnage, code source, journal de pré-traitement et base de données d’entraînement.

La mise en œuvre de ces investigations numériques soulève toutefois des difficultés juridiques substantielles relatives à la protection du secret des affaires du défendeur. Les algorithmes d’entraînement, les architectures de pondération et les méthodes de filtrage constituent des actifs hautement confidentiels pour les entreprises technologiques. Pour concilier le droit à la preuve de l’ayant droit et la préservation légitime des secrets d’affaires, le juge des requêtes ordonne fréquemment le placement sous séquestre provisoire des fichiers saisis, renvoyant à une instance ultérieure en référé le soin d’organiser la levée des scellés ou l’établissement d’une version non confidentielle des éléments techniques nécessaires au débat judiciaire.

Sur le fond, l’appréciation de l’atteinte portée aux œuvres protégées s’opère selon les critères classiques dégagés par les juridictions du fond. Dans son arrêt précité du 23 janvier 2026, la Cour d’appel de Paris rappelle le principe selon lequel « Il est constant que la contrefaçon s’apprécie au regard des ressemblances existant entre deux produits en cause, ainsi que de l’impression visuelle d’ensemble qui s’en dégage. » Dans le cas de l’intelligence artificielle, cette analyse comparative porte à la fois sur la reprise substantielle d’éléments originaux dans les contenus générés en sortie et sur la reconstitution des actes d’ingestion illicite intervenus en amont au cours de l’entraînement.

B. La réparation indemnitaire, l’injonction d’éviction des jeux de données et la conformité européenne

Lorsque la matérialité de la contrefaçon est reconnue par la juridiction civile, l’évaluation des mesures réparatrices obéit aux critères impératifs fixés par l’article L. 331-1-3 du Code de la propriété intellectuelle. Aux termes de ce texte, la juridiction prend en considération les conséquences économiques négatives de l’atteinte aux droits, dont le manque à gagner et la perte subis par la partie lésée, le préjudice moral causé à cette dernière et les bénéfices réalisés par l’auteur de l’atteinte, y compris les économies d’investissements intellectuels, matériels et promotionnels que celui-ci a retirées de l’acte illicite.

La Cour d’appel de Paris a souligné la rigueur de cette évaluation légale dans sa décision du 23 janvier 2026, rappelant que « Selon l’article L. 331-1-3 du code de la propriété intellectuelle, pour fixer les dommages et intérêts, la juridiction prend en considération les conséquences économiques négatives de l’atteinte aux droits, dont le manque à gagner et la perte subies par la partie lésée, le préjudice moral causé à cette dernière et les bénéfices réalisés par l’auteur de l’atteinte. » Dans le contentieux opposant les créateurs aux fournisseurs de modèles de langage, l’évaluation du préjudice économique ne peut se limiter au seul prix unitaire des œuvres numérisées. Elle doit intégrer l’économie colossale réalisée par le contrefacteur qui s’est dispensé d’acquérir les licences appropriées pour constituer des bases d’apprentissage de plusieurs centaines de milliers d’ouvrages, tout en tenant compte de la banalisation et de la perte d’exclusivité subies par les catalogues des maisons d’édition.

À côté de la réparation pécuniaire, les demandes d’injonction constituent le véritable cœur stratégique des litiges modernes. Les titulaires de droits sollicitent du tribunal qu’il ordonne, sous astreinte financière comminatoire, l’interdiction de commercialiser les versions du modèle entraînées sur les corpus contrefaisants, ainsi que la destruction ou le retrait pur et simple des jeux de données constitués de manière illicite. Une telle condamnation peut contraindre le fournisseur d’intelligence artificielle à procéder à un ré-entraînement complet de son modèle sur des données vérifiées, ce qui représente un coût industriel et financier dissuasif.

Par ailleurs, les demandeurs veillent à articuler leurs prétentions indemnitaires sur le terrain complémentaire de la concurrence déloyale et du parasitisme, sous réserve de caractériser des faits distincts de la stricte atteinte au monopole d’auteur. Dans son arrêt rendu le 23 juin 2021, la Chambre commerciale de la Cour de cassation a posé la règle stricte selon laquelle « dès lors que l’action en concurrence déloyale doit être fondée sur des actes distincts de ceux sanctionnés au titre de la contrefaçon », la sanction du parasitisme suppose de démontrer une volonté délibérée de se placer dans le sillage économique d’autrui pour tirer profit de ses investissements sans bourse délier.

Enfin, le dispositif civil s’insère dans un environnement normatif européen de plus en plus contraignant. Le règlement européen 2024/1689 du 13 juin 2024 sur l’intelligence artificielle impose aux fournisseurs de modèles à usage général de mettre en œuvre des politiques de respect du droit d’auteur européen et de publier des résumés exhaustifs des données utilisées pour l’entraînement. Les sanctions administratives encourues en cas de manquement aux obligations de transparence peuvent atteindre jusqu’à 15 millions d’euros ou 3 % du chiffre d’affaires mondial annuel. L’articulation entre ces obligations de transparence réglementaire et les sanctions civiles du Code de la propriété intellectuelle, qui prévoient également des peines pénales en cas de contrefaçon intentionnelle à l’article L. 335-2 du Code de la propriété intellectuelle, dessine un cadre juridique renforcé au sein duquel l’innovation algorithmique doit impérativement composer avec la primauté des droits de la création.

Conclusion

L’essor de l’intelligence artificielle générative marque un tournant structurel dans l’histoire de la propriété intellectuelle. L’ingestion massive d’œuvres de l’esprit pour entraîner des modèles algorithmiques complexes ne peut s’affranchir des principes fondamentaux du droit d’auteur sans menacer la pérennité économique et culturelle des secteurs de la création. Face aux limites avérées des exceptions de fouille de textes et de données et à l’inefficacité pratique des mécanismes d’opt-out dans un contexte d’opacité technique, la réponse du droit positif s’organise autour d’un renforcement probatoire indispensable.

L’instauration d’une présomption légale d’exploitation des contenus culturels par les fournisseurs d’intelligence artificielle, confortée par les obligations de transparence du règlement européen, rééquilibre l’égalité des armes devant les juridictions civiles. En contraignant les concepteurs de modèles à documenter rigoureusement la provenance de leurs corpus d’entraînement et à justifier de titres d’exploitation réguliers, ce nouveau cadre juridique favorise l’émergence d’un marché vertueux fondé sur la négociation de licences sectorielles et le respect mutuel des créateurs et des innovateurs. Les entreprises et les détenteurs de droits disposent désormais d’un arsenal procédural et jurisprudentiel opérationnel pour sécuriser leurs actifs incorporels et défendre la valeur de leurs créations.

Source : Cour de cassation – Base Open Data « Judilibre » & « Légifrance ».