Elke dag stellen miljoenen mensen vragen aan ChatGPT en andere AI-chatbots. Binnen enkele seconden verschijnt een antwoord. Maar waar halen die systemen eigenlijk hun kennis vandaan? Achter de vlotte antwoorden schuilt een ongemakkelijke realiteit die steeds vaker tot juridische discussies leidt. Sommige generatieve AI-modellen werden getraind met miljoenen illegaal verkregen boeken.
Die vaststelling raakt aan een fundamentele vraag. Mag technologische innovatie bouwen op illegaal verkregen kennis?
In een recente masterproef aan de KU Leuven Van Kunst naar Kunstmatigheid onderzocht Eva Van Remoortel wat het auteursrecht in Europa hierover zegt. De conclusie is opvallend duidelijk: commerciële AI-bedrijven mogen auteursrechtelijk beschermde boeken uit illegale online bibliotheken niet gebruiken om hun modellen te trainen. Wordt de rechtsgrond waarop AI-bedrijven zich beroepen daarmee drijfzand?
De weg van roman naar algoritme
Het scenario is eenvoudig. Een auteur werkt jarenlang aan een boek. Vervolgens duikt dat boek op in een illegale online bibliotheek, waar het gratis kan worden gedownload, zonder toestemming van de schrijver of uitgever. Niet gekocht, niet geleend. Gestolen. Daarna belandt het in de enorme datasets waarmee een AI-model leert schrijven, denken en redeneren.
Dergelijke websites, schaduwbibliotheken genoemd, bestaan al jaren. Het bekendste voorbeeld is Library Genesis of LibGen. Miljoenen auteursrechtelijk beschermde boeken zijn er met enkele muisklikken te downloaden.
In recente Amerikaanse rechtszaken tegen AI-bedrijven, zoals Meta en Anthropic, kwam aan het licht dat illegale boeken uit dit soort bibliotheken werden gebruikt om taalmodellen te trainen – ook boeken van Belgische auteurs.
Dat raakt een gevoelige snaar. Generatieve AI mag dan razendsnel teksten produceren, maar draait op boeken die ooit door mensen zijn geschreven. Zonder auteurs, geen taalmodel.
Wat zegt het Europese auteursrecht?
Een uitgebreide juridische analyse van het Europese auteursrecht geeft een verrassend helder antwoord. Het auteursrecht geeft auteurs het exclusieve recht om hun werk te laten reproduceren. Tegelijk bestaat er echter een uitzondering voor commerciële tekst- en datamining. Die techniek laat toe grote hoeveelheden tekst automatisch te analyseren om patronen, verbanden en structuren te ontdekken. Maar daar hangt wel een belangrijke voorwaarde aan vast: de gebruikte werken moeten rechtmatig toegankelijk zijn.
Daar gaat het mis. Dat een boek publiek beschikbaar is op het internet, betekent niet automatisch dat het legaal beschikbaar is. Een werk dat zonder toestemming van de auteur online staat, blijft een illegale bron.
Volgens de thesis van Van Remoortel vallen boeken uit dergelijke schaduwbibliotheken daarom buiten de bestaande Europese uitzondering voor commerciële tekst- en datamining. Voor de betrokken AI-bedrijven vormt dat een belangrijke juridische beperking.
De economische inzet
De discussie gaat inmiddels echter over veel meer dan een technische interpretatie van auteursrechten. De Europese boekensector vertegenwoordigt een markt van meer dan 36 miljard euro en biedt werk aan ruim een half miljoen mensen. Jaarlijks verschijnen ongeveer 580.000 nieuwe titels. Achter elk boek zitten auteurs, vertalers en uitgevers die leven van inkomsten uit creatieve arbeid.
Tegelijkertijd groeit de economische macht van AI-bedrijven in snel tempo. Terwijl auteurs vrezen voor inkomensverlies en concurrentie van automatisch gegenereerde teksten, realiseren sommige spelers in de AI-sector inmiddels miljardenomzetten. Dat voedt het gevoel van een groeiende kloof: technologiebedrijven bouwen winstgevende systemen op teksten, waarvoor de auteurs nooit werden vergoed.
Precies daarin schuilt de paradox van generatieve AI. De technologie lijkt steeds autonomer te worden, maar blijft afhankelijk van menselijke creativiteit. Onderzoek wijst erop dat taalmodellen kwaliteit verliezen, wanneer ze zich voeden met door AI gegenereerde teksten, een fenomeen dat bekendstaat als model collapse.
Met andere woorden: zonder menselijke auteurs droogt uiteindelijk de bron van de generatieve AI onherroepelijk op.
Waarom auteurs naar de rechter trekken
Steeds meer schrijvers zoeken daarom hun gelijk in de rechtbank, te beginnen in de Verenigde Staten. Het Amerikaanse auteursrecht verschilt sterk van het Europese systeem. Rechters kunnen in de VS per geval afwegen of het gebruik van beschermd materiaal toch geoorloofd is via de fair use-doctrine. Europa werkt met een gesloten systeem van uitzonderingen. Wat niet uitdrukkelijk is toegestaan, blijft verboden.
Toch blijkt ook in de VS de herkomst van trainingsdata een heikel punt. Een rechter stelde in een zaak tegen Anthropic dat het downloaden en bewaren van miljoenen illegale boekkopieën niet zomaar kan worden goedgepraat omdat het een innovatieve techniek ten goede komt. De zaak eindigde uiteindelijk in een schikking van 1,5 miljard dollar, de grootste auteursrechtelijke schikking ooit in de VS.
Ondanks de verschillen tussen beide rechtssystemen groeit daardoor aan weerszijden van de Atlantische Oceaan hetzelfde besef: innovatie kent grenzen. Illegale bronnen vormen er daar één van.
Gelijk hebben is niet hetzelfde als gelijk krijgen
Toch betekent juridische duidelijkheid nog geen overwinning voor auteurs.
Het grootste probleem blijkt de handhaving. Veel AI-modellen worden buiten Europa getraind, terwijl ze wereldwijd worden gebruikt. Bovendien weten auteurs meestal niet of hun boeken in trainingsdatasets zijn opgenomen. Zelfs wanneer zij vermoeden dat hun rechten werden geschonden, ontbreekt vaak het bewijs.
Daardoor ontstaat een ongelijke situatie. Technologiebedrijven beschikken over de data, de middelen en de technische expertise. Individuele auteurs en kleine uitgevers moeten ondertussen bewijzen dat hun rechten geschonden zijn, zonder toegang tot de informatie die daarvoor nodig is.
De Europese AI-verordening verplicht bedrijven wel tot meer transparantie, maar in de praktijk blijft vaak onduidelijk welke boeken precies werden gebruikt. Trainingsdata worden vaak omschreven met vage termen als “publiek beschikbare inhoud” of “data van het open web”.
Voor een auteur die wil nagaan of zijn boek werd gebruikt, is dat ongeveer even informatief als een restaurantrekening waarop alleen “eten” staat.
België probeert intussen de kraan dicht te draaien. In een rechtszaak liet de ondernemingsrechtbank in Brussel de toegang blokkeren tot verschillende schaduwbibliotheken, waaronder LibGen. Dat maakt het moeilijker om nieuwe illegale kopieën te verspreiden. Maar voor boeken die al in AI-systemen zijn verwerkt, biedt zo'n blokkering geen oplossing meer. Zodra een taalmodel eenmaal met bepaalde teksten is getraind, kunnen die niet zomaar weer worden verwijderd. Dat vraagt een technisch ingewikkeld en bijzonder duur proces.
Daardoor verschuift het debat geleidelijk van de vraag wat wettelijk mag, naar de vraag wat praktisch afdwingbaar is. Daarmee legt de masterproef een ongemakkelijke waarheid bloot. Het Europese auteursrecht weet perfect wat verboden is. Het weet alleen veel minder goed hoe het dat verbod moet afdwingen in een digitale economie die moeiteloos grenzen overschrijdt.
Intussen ontstaan er ook alternatieven. Sommige AI-projecten werken uitsluitend met gelicentieerde data. Nieuwe labels moeten zichtbaar maken welke boeken volledig door mensen zijn geschreven. Het zijn signalen dat een andere aanpak mogelijk is.
Meer dan een juridisch conflict
De belangrijkste conclusie van het onderzoek reikt daarom verder dan het auteursrecht alleen. De discussie gaat niet enkel over schrijvers tegenover technologiebedrijven. Ze raakt aan een bredere maatschappelijke vraag: hoe beschermen we menselijke creativiteit in een economie die steeds meer draait op data?
Achter elke dataset schuilt uiteindelijk immers menselijk werk. Achter elk boek zit iemand die jaren heeft onderzocht, geschreven en herschreven.
De toekomst van AI zal niet alleen afhangen van krachtigere computers of betere algoritmen. Ze zal ook afhangen van de vraag hoe een samenleving omgaat met de makers van de kennis waarop die technologie gebouwd is.
Want zonder nieuwe boeken valt er uiteindelijk, zelfs voor het slimste AI-model, niets nieuws meer te leren.
Bibliografie
A. Wetgeving
3. Nationaal
België
Verenigde Staten
B. Rechtspraak
1. Internationale en buitenlandse rechtspraak
Frankrijk
Duitsland
Verenigde Staten
2. Europese rechtspraak
3. Belgische rechtspraak
C. Rechtsleer
1. Boeken
2. Artikels
D. Andere bronnen
1. Europese documenten
Documenten van de Europese Commissie
Documenten van het Europees Parlement
Documenten van het AI-bureau
Documenten van het EUIPO
2. Overige teksten
3. Online bronnen
(laatst geconsulteerd op 15 mei 2026)