Množí se obvinění z ničení knih kvůli trénování AI. Co autorská práva?

V posledních týdnech se množí svědectví majitelů antikvariátů, kteří prodali velké množství použitých knih. Má se za to, že tyto knihy kupují americké společnosti zabývající se umělou inteligencí (AI), naskenují je a obsah pak používají k trénování svých modelů. Kromě toho společnosti čelí obviněním, že knihy v průběhu tohoto procesu fyzicky ničí. Je to pravda? Nejen na tuto otázku se snaží odpovědět analýza německé agentury DPA.

 

Odkud se obvinění berou?

Pocházejí především od majitelů antikvariátů. Markus Brandis, předseda Svazu německých antikvářů, uvádí četné případy, kdy antikvariáty náhle obdržely neobvyklé objednávky. Během několika měsíců tak podle něj někteří antikváři vydělali statisícové částky v eurech (100 000 eur odpovídá zhruba 2,4 milionu Kč). „To je opravdu pozoruhodné,“ dodal.

Objednávky většinou přicházely v noci, sdělil antikvář DPA. Zákazníci často pocházeli ze Severní Ameriky. Objednávali především takzvané neprodejné knihy, tedy tituly, jež již dlouho stály na regálech a nikdo je nekupoval.

Není to pro antikvariáty výhodná příležitost?

Ačkoli se obchod s antikvariátními knihami díky novým kupcům krátkodobě oživí, z dlouhodobého hlediska hovoří Brandis o barbarském přístupu, který důrazně odmítá. Skutečnost, že společnosti zabývající se AI ničí knihy kvůli skenování, přitom pro něj nepředstavuje největší problém. U většiny z nich existuje velké množství výtisků, mnohem zásadnější je tak otázka autorských práv.

 

Otázka masivního porušování autorských práv

Klasická knihkupectví zatím neobdržela žádné srovnatelné objednávky, uvedl Thomas Koch, tiskový mluvčí Německého svazu knihkupců. I on však hovoří o „velmi znepokojivém vývoji“„jednoznačném a masivním porušování autorských práv“.

Kdo za tím stojí?

Předpokládá se, že za nákupy stojí velcí vývojáři AI. Pokud jde o americkou společnost Anthropic, provozovatele AI modelů Claude, existují k tomu i konkrétní důkazy.

Podle soudních dokumentů Anthropic nakupoval knihy ve velkém množství za účelem trénování AI. Dokumenty byly zveřejněny v návaznosti na žalobu týkající se možného porušení autorských práv, kterou proti společnosti podali spisovatelé.

Mezi zveřejněnými dokumenty je i interní plánovací dokument, který stručně popisuje cíle plánu s názvem Projekt Panama. „Projekt Panama je náš záměr destruktivně naskenovat všechny knihy na světě,“ stojí v dokumentu. Je tím myšleno úmyslné ničení knih při skenování, při němž se například odřezávají hřbety knih.

„Claude je trénován na směsi veřejně dostupných webových dat, komerčně zakoupených datových sad a dat generovaných vlastními prostředky,“ odpověděla společnost na dotaz DPA.

Pořizování knih je v celém odvětví AI široce rozšířeným postupem při trénování velkých jazykových modelů. „V žádném z našich programů pro nákup dat nedochází k ničení vzácných nebo antikvárních knih,“ uvedl Anthropic.

„Respektujeme autorská práva, spolupracujeme s ostatními a dáváme vydavatelům kontrolu nad tím, jak se jejich obsah využívá,“ sdělila DPA společnost Google ze skupiny Alphabet. V někdejším projektu Google Books prý firma „pomohla stovkám knihoven po celém světě digitalizovat díla ve veřejné doméně pro budoucí generace – a přitom vrátila fyzické výtisky v neporušeném stavu“.

V nedávné žalobě vydavatelů je Googlu vyčítáno, že v rozporu s autorskými právy použila data z Google Books do svých modelů AI Gemini. Společnost se k tomu s odkazem na probíhající řízení nevyjádřila. Konkurenční OpenAI na dotaz DPA nereagovala.

Proč společnosti zabývající se AI skenují knihy?

Chatboty, jako jsou ChatGPT nebo Claude, jsou založeny na takzvaných velkých jazykových modelech (LLM). Jde o statistické modely trénované na obrovských objemech textu, vysvětluje profesor Sebastian Schelter z Technické univerzity v Berlíně, který se zabývá výzkumem AI. „Empiricky se zjistilo, že čím větší modely jsou a čím větším množstvím dat byly trénovány, tím lépe fungují,“ řekl.

První modely byly trénovány na datech z internetu, protože ta byla nejdostupnější. „V určitém okamžiku se do nich v podstatě nahrál celý veřejně dostupný internet,“ uvedl Schelter. Proto už několik let hledají firmy data, jež na internetu nejsou.

Při hledání materiálu pro trénování AI nicméně dochází také ke konkurenci mezi jednotlivými firmami z oboru. „Pokud se jedné firmě podaří získat přístup k určitým datům, která jiná firma nemá, může to automaticky představovat konkurenční výhodu,“ upřesnil Schelter.

Je nutné knihu kvůli skenování zničit?

Krátká odpověď zní nikoliv.

Naskenovat knihu, aniž by se poškodila, je poměrně náročné, protože ne každou knihu lze otevřít na 180 stupňů a stránky je nutné otáčet jednotlivě. DPA to sdělila členka představenstva Německého knihovnického svazu Kathrin Kessenová, která se zabývá digitalizací knih.

Rychlejší a výrazně levnější je podle ní oddělit stránky od hřbetu skenované knihy. „To bychom v knihovnách s knihami nikdy neudělali,“ dodala Kessenová. Jelikož se však u společností zabývajících se AI jedná o hromadné zpracování, může pro ně být jednodušší použití takzvaných podavačových skenerů, které dokážou zpracovávat volné stránky po hromadách.

V zásadě však nikdo nemůže nikomu předepisovat, co má s knihou dělat poté, co si ji koupil, říká Kessenová. Téma přesto vyvolává silné emoce. „Zejména v Německu se téma ničení nebo dokonce pálení knih samozřejmě dotýká lidí obzvláště citlivě,“ připomněla Kessenová v narážce na období nacistické diktatury.

Co říká německé právo?

V Německu je skenování knih chráněných autorským právem zakázáno. Skenování je přípustné pouze v případě, že s tím souhlasí držitel příslušných práv nebo se uplatní příslušná zákonná výjimka (například pro soukromou kopii). Skutečnost, že si člověk knihu zakoupil, na tom nic nemění.

Skenování knih pro účely trénování AI je však povoleno, nicméně pouze při dodržení přísných podmínek, poznamenal advokát Christian Solmecke. Zřejmě nejdůležitější podmínkou je, že přístup k dílu musí být zákonný. „K tomu stačí legální nákup výtisku, a to i použitého,“ uvedl Solmecke. Odměna pro autory však není stanovena. To je také jeden z hlavních bodů kritiky této normy.

Jak vyplývá z amerických soudních dokumentů, Anthropic a další firmy z oboru AI získávaly knihy ve velkém množství neoprávněně, především prostřednictvím dvou on-line sbírek pirátských kopií. Anthropic však zdůrazňuje, že modely vycvičené tímto způsobem nebyly zveřejněny pro komerční účely a že z nich firma neměla žádné výnosy.

Záleží na tom, že jsou knihy zničeny?

Další ustanovení německého autorského zákona stanoví, že kopie musí být smazány, jakmile již nejsou potřebné pro trénování AI. Právě v tomto bodě se situace stává choulostivou, protože shromážděná data, na nichž se AI trénuje, se obvykle po jednorázovém použití nesmažou, ale uchovávají se pro pozdější generace modelů, tvrdí Solmecke.

V soudním řízení proti společnosti Anthropic v USA byl právě bod týkající se mazání dat rozhodující. Zničení knih bylo totiž součástí odůvodnění soudu, proč byl postup zákonný. „Ve výsledku tedy nešlo o vytvoření dalšího exempláře, ale pouze o změnu formátu. Z právního hlediska srovnatelnou s přenesením obsahu zakoupeného CD do MP3 přehrávače,“ řekl Solmecke. Likvidace knih byla tedy z právního hlediska pro společnost zabývající se AI pozitivní.

Které právo aktuálně platí?

Rozhodující je země, v níž se knihy naskenují a zlikvidují. Jelikož se skenují v USA, platí tamní právo. I když již byly v první instanci vyneseny tři soudní rozsudky týkající se hodnocení trénování AI (dva ve prospěch společností zabývajících se AI, jeden v jejich neprospěch), právní situace v této věci se v USA zatím jednoznačně nevyjasnila, uzavírá DPA.

 

Zdroj: ČTK
Foto: pixabay.com

Go to TOP