Technologické firmy v roli kulturního barbara aneb Staré knihy jako krmení pro umělou inteligenci

Existují věci, které nelze převést jen na data. Starý dopis. Rukopis s poznámkami na okraji. Kniha, jejíž zažloutlé stránky přežily desetiletí nebo staletí lidských rukou, knihoven, stěhování, válek, domácností a zapomnění. Taková kniha není pouze nosičem textu. Je svědectvím. Je stopou lidské snahy porozumět světu. A právě proto působí tak znepokojivě zprávy, že některé technologické firmy kupují tištěné knihy ve velkém, rozřezávají jejich vazby, skenují stránky a fyzické originály následně likvidují, aby získaly trénovací data pro systémy umělé inteligence

Tento obraz je bolestivý nejen pro knihovníky, antikváře a milovníky starých knih. Je bolestivý i pro každého, kdo chápe kulturu jako dlouhou, křehkou a často zranitelnou kontinuitu lidské paměti. Protože kniha není jen „obsah“. Není jen text, který lze zkopírovat, tokenizovat a proměnit v trénovací materiál pro jazykový model. Kniha je také předmět, vztah, kontext, práce autora, editora, sazeče, tiskaře, knihovníka, čtenáře i celé společnosti, která ji uchovala. Když ji zničíme jen proto, že její obsah potřebujeme rychle „vytěžit“, říkáme tím něco velmi nepříjemného o našem vztahu k poznání.

Datový hlad nové průmyslové revoluce

Umělá inteligence, zejména velké jazykové modely, potřebuje obrovské množství textů. Nestačí jí krátké příspěvky ze sociálních sítí, roztříštěné webové stránky nebo nekonečné proudy reklamních a optimalizovaných textů. Pro kvalitní jazykové modely jsou mimořádně cenné knihy: dlouhé, redigované, promyšlené a stylisticky bohaté texty. Právě proto se knihy staly surovinou nové datové ekonomiky. Článek Ars Technica upozorňuje, že AI firmy soupeří o vysoce kvalitní dlouhé texty, které se ve velkém nacházejí právě v knihách.

V tomto závodě však často vítězí rychlost nad rozvahou. Destruktivní skenování je průmyslově jednoduché: knize se odřízne hřbet, jednotlivé stránky se protáhnou skenerem a fyzický svazek se po digitalizaci vyhodí nebo zrecykluje. Tento postup je levnější a rychlejší než šetrné skenování knihy stránku po stránce. Právě to je ale jádro problému. Co je efektivní z hlediska byznysu, může být zhoubné z hlediska kulturní paměti.

Technologický průmysl zde opět naráží na starý morální problém: umíme něco udělat, ale neptáme se dostatečně, zda bychom to takto dělat měli. Ekonomická logika nám říká, že text je cenný jako vstupní materiál. Kulturní logika nám připomíná, že kniha je také dědictví. Když se tato druhá logika vytratí, zůstane jen těžba. A těžba má vždy sklon považovat krajinu, les, tělo i paměť za zásobárnu surovin.

Ničení knih není technologická nutnost

Nejznepokojivější na celé věci je, že ničení knih není nevyhnutelné. Existují nedestruktivní metody digitalizace. Ars Technica připomíná, že Google si už v roce 2009 patentoval technologii nedestruktivního skenování knih. Takové postupy však mohou být pomalejší, dražší a také náchylné k chybám, například kvůli zakřivení stránky, vynechaným stranám nebo nevhodně zachyceným rukám pracovníků při spěchu.

Podstatné ale je, že alternativa existuje. Nejde tedy o spor mezi digitalizací a nedigitalizací. Nejde o nostalgické odmítání technologií. Jde o spor mezi dobrou a špatnou digitalizací. Mezi digitalizací jako službou veřejnosti a digitalizací jako soukromou těžbou. Mezi přístupem, který chce uchovat text i fyzickou knihu, a přístupem, který v knize vidí překážející papírový obal kolem dat.

Právě zde se ukazuje hlubší selhání části současného technologického myšlení. Místo aby se učilo od knihoven, archivů a paměťových institucí, často se chová, jako by celé kulturní dědictví bylo jen nedostatečně využitou databází. Jenže knihovníci a archiváři vědí něco, co technologický spěch snadno přehlíží: uchovávání poznání není totéž jako jeho extrakce.

Internet Archive: digitalizace jako péče, nikoli konzumace

Silným protipólem destruktivního skenování je práce Internet Archive. Blogový příspěvek z roku 2021 o skenerce Eliza Zhang ukazuje úplně jiný přístup. Eliza Zhang pracuje v Internet Archive od roku 2010 a její práce spočívá ve skenování knih „těžkou cestou“, tedy stránku po stránce, bez ničení vazby.

Tento postup není romantickou pózou. Je to odborná praxe založená na zkušenosti. Internet Archive podle svého blogu testoval i komerční automatizované skenery s vakuovým ramenem na obracení stránek, ale ty se neosvědčily u křehkých knih, vzácných svazků a speciálních sbírek. Andrea Mills, která se podílí na vedení knižních skenovacích operací, v této souvislosti uvedla, že čisté a suché lidské ruce jsou nejlepším způsobem, jak obracet stránky.

Popis práce Elizy Zhang působí téměř jako lekce trpělivosti. Sklo skeneru zvedá pedálem, obrací stránku, nastavuje kamery, kontroluje čitelnost, zaznamenává rozkládací přílohy a hlídá, aby se nic neztratilo. Pokud software vytvořený inženýry Internet Archive odhalí vynechanou nebo rozmazanou stránku, proces ji upozorní a stránka se skenuje znovu. V době publikování blogu měla Eliza Zhang naskenováno více než 3 miliony stran, 14 000 rozkládacích příloh a 18 000 položek, převážně knih. Jejím cílem bylo garantovat „nulové chyby“.

To je důležitý obraz. Nejen technický, ale kulturní. Digitalizace zde není aktem spotřeby. Je aktem péče. Kniha se nestává mrtvým zdrojem, který je třeba rozřezat a vytěžit. Zůstává předmětem, který si zaslouží ohled. Digitální kopie nevzniká jako náhrada za zničený originál, ale jako most k širšímu přístupu.

Když právo nestačí chránit kulturní paměť

Kauza společnosti Anthropic ukazuje, jak složité je spoléhat se pouze na autorské právo. Podle shrnutí U.S. Copyright Office Fair Use Index společnost Anthropic používala pro své modely knihy získané z různých zdrojů: jednak údajně miliony neoprávněných kopií z pirátských webů, jednak hromadně nakoupené tištěné knihy, které následně rozebrala, naskenovala a použila k vytvoření interní knihovny. Soud v případu Bartz v. Anthropic PBC rozlišil mezi trénováním modelů, převodem legálně zakoupených knih do digitální interní podoby a použitím pirátských zdrojů.

Právní analýza Goodwin uvádí, že soudce William Alsup považoval trénování modelů na chráněných dílech za „exceedingly transformative“ a převod legálně zakoupených tištěných knih na interní digitální kopie také vyhodnotil jako fair use, pokud digitální kopie nebyly dále sdíleny nebo prodávány mimo společnost. Naopak použití pirátských kopií k budování centrální knihovny soud za fair use nepovažoval.

Tento právní výsledek vyvolává zásadní otázku: chrání autorské právo opravdu to, co potřebujeme chránit? Z pohledu práva může být rozhodující, zda byla kniha koupena, zda byla kopie distribuována a zda vznikla tržní újma. Z pohledu kultury je však podstatná ještě jiná věc: zda byl zničen fyzický exemplář, který mohl mít historickou, sběratelskou, knihovní nebo duchovní hodnotu. Právo se často dívá na rozmnoženinu, trh a užití. Kulturní paměť se dívá také na stopu, kontext a nenahraditelnost.

A zde se ukazuje mezera mezi legalitou a etikou. Něco může být podle určitého právního výkladu dovoleno, a přesto to může být kulturně barbarské. Ne každé povolené jednání je jednání odpovědné. A ne každé „fair use“ je férové vůči budoucím generacím.

Staré knihy jako duchovní dědictví, ne jako mrtvá biomasa dat

Staré knihy představují víc než historický obsah. Jsou součástí duchovního dědictví lidstva. Ne nutně v náboženském smyslu, ale v hlubším civilizačním významu. Nesou v sobě způsoby, jak lidé přemýšleli, pochybovali, věřili, měřili svět, učili se, hádali se, vychovávali děti, vyprávěli příběhy a předávali zkušenost. I omyly v nich obsažené jsou součástí dějin poznání.

Právě proto je tak nebezpečné redukovat knihy na „čistá data“. Když je jazykový model natrénován na milionech vět, nevidí cestu, kterou tyto věty prošly. Nevidí knihovníka, který knihu opravil. Nevidí čtenářku, která si podtrhla větu na okraji. Nevidí lokální vydání, zapomenutý náklad, ex libris, papír, vazbu, opotřebení ani ticho archivního skladu. Vidí vzorce. A pokud takto začneme vidět i my, ztratíme něco podstatného.

Kultura není jen soubor informací. Kultura je vztah k informacím. Je to způsob, jak se k nim chováme, jak je uchováváme, jak je sdílíme a jaké meze si stanovujeme. Pokud dovolíme, aby se staré knihy staly jen palivem pro soukromé modely, ztrácíme schopnost rozlišovat mezi vzděláním a těžbou, mezi pamětí a extrakcí, mezi pokrokem a bezohledností.

Podezřelé nákupy a strach knihkupců

Obavy nejsou pouze teoretické. Ars Technica popisuje, že knihkupci začali upozorňovat na podezřelé hromadné objednávky starších nebo obskurních knih. Zmíněna je mimo jiné irská firma Kennys Bookshop, která podle článku zaznamenala objednávku 5 000 obskurních titulů. Podezření vyvolalo i to, že kupující se nepokoušel smlouvat o ceně, což bylo v kontextu podobných objednávek popsáno jako varovný signál.

Tomás Kenny z Kennys Bookshop podle Ars Technica uvedl, že pokud by někdo knihy skenoval s cílem využít duševní vlastnictví, jeho knihkupectví u toho nechce být. Z výpovědi je patrné, že nejde jen o obchodní otázku. Knihkupci se ocitají na hranici morálního rozhodování: krátkodobě mohou na velkých objednávkách vydělat, dlouhodobě však mohou přispět k likvidaci obtížně dostupných knih a k oslabení autorských práv i čtenářského ekosystému.

Tento detail je velmi důležitý. Trh s knihami není anonymní potrubí. Tvoří jej lidé, kteří často rozumějí hodnotě starých titulů lépe než technologické firmy. Antikváři a knihkupci mohou sehrát roli poslední obranné linie. Mohou odmítat podezřelé objednávky, ptát se na účel nákupu a chránit knihy, které by jinak zmizely v industriálním procesu.

Zisk nad vztahy, rychlost nad odpovědností

Na celém příběhu je zneklidňující známý vzorec. Nejprve přijde technologická možnost. Pak vznikne závod o náskok. Poté se objeví právní argumenty, proč je nové jednání přípustné. Teprve nakonec společnost začne řešit, co se vlastně poškodilo. Tento postup známe ze sociálních sítí, z ekonomiky pozornosti, z masového sběru osobních dat i z automatizovaného rozhodování.

Podobný mechanismus vidíme i zde. Firmy potřebují data. Knihy jsou kvalitní data. Destruktivní skenování je rychlé. Pokud je právně hájitelné, obchodní logika má tendenci jej použít. Jenže právě zde je nutné říci jasné ne. Ne proto, že bychom odmítali umělou inteligenci jako takovou. Ale proto, že odmítáme představu, že ve jménu technologického pokroku smí být vše převedeno na palivo.

Zdravé společenské vztahy stojí na důvěře, úctě a odpovědnosti. Autoři musí vědět, že jejich práce nebude bezohledně vysávána mimo smysluplná pravidla. Knihovny musí vědět, že digitalizace nebude znamenat fyzickou likvidaci sbírek. Čtenáři musí vědět, že vzácné a těžko dostupné knihy nezmizí jen proto, že se někomu hodí jako tréninkový materiál. A společnost musí vědět, že technologické firmy nejsou novými vlastníky lidské paměti.

Existují lepší cesty

Kritika destruktivního skenování neznamená odmítnutí digitalizace. Právě naopak. Smysluplná digitalizace je jedním z nejdůležitějších nástrojů uchovávání a zpřístupňování vědění. Internet Archive ukazuje, že knihy lze digitalizovat tak, aby byly zachovány i fyzicky. Je to pomalejší, pracnější a dražší, ale právě proto důvěryhodnější.

Další cestu představují projekty založené na veřejné doméně a institucionální odpovědnosti. Harvard Law School popsala Institutional Data Initiative jako snahu zpřístupnit veřejně dostupné materiály z knihoven a znalostních institucí pro AI a další využití způsobem, který respektuje hodnoty těchto institucí. Projekt počítá mimo jiné s veřejně-doménovými knihami naskenovanými v rámci Google Books.

Takové iniciativy ukazují, že AI nemusí stát proti knihovnám, autorům a veřejnosti. Může s nimi spolupracovat. Ale pouze tehdy, pokud přijme pravidla: transparentnost zdrojů, respekt k autorským právům, ochranu vzácných exemplářů, nedestruktivní postupy tam, kde je to možné, a veřejný prospěch jako víc než marketingovou frázi.

Co bychom měli požadovat od AI firem

Pokud má být umělá inteligence opravdu užitečnou technologií, nemůže být budována na bezohledném vztahu ke kultuře. Od firem vyvíjejících AI bychom proto měli požadovat několik základních věcí.

Za prvé transparentnost. Veřejnost, autoři, knihovny i regulátoři by měli vědět, odkud trénovací data pocházejí. Není přijatelné, aby se kulturní dědictví proměňovalo v soukromou datovou zásobu za závojem mlčenlivosti a obchodního tajemství.

Za druhé respekt k autorským právům. Spor o fair use v USA neznamená, že celosvětově existuje morální bianko šek na používání knih. Autoři nejsou pouhými dodavateli suroviny pro stroje. Jejich práce má hodnotu a ochranu.

Za třetí ochranu fyzických knih. Zvláště staré, vzácné, regionální, obskurní a obtížně dostupné tituly by neměly končit v destruktivních skenovacích linkách. Tam, kde existuje riziko nenahraditelnosti, má mít přednost zachování před rychlostí.

Za čtvrté spolupráci s knihovnami a paměťovými institucemi. Technologické firmy by se měly učit od těch, kteří po generace pečují o poznání. Nestačí najmout odborníky na data. Je třeba poslouchat také archiváře, knihovníky, historiky, autory a čtenáře.

Za páté veřejnou odpovědnost. Pokud AI firmy těží z dědictví lidstva, měly by také přispívat k jeho ochraně. Nejen využívat staré knihy, ale pomáhat je uchovávat, katalogizovat, opravovat a zpřístupňovat.

Kniha není překážka pokroku

Možná bude někdo namítat, že staré knihy se přece mají digitalizovat, protože jinak zůstávají zavřené ve skladech a jejich obsah se ztrácí. To je pravda jen napůl. Ano, digitalizace je důležitá. Ano, knihy mají být přístupné. Ano, umělá inteligence může pomoci při vyhledávání, překladu, analýze i zpřístupnění zapomenutých textů. Ale z toho neplyne, že je v pořádku ničit fyzické knihy kvůli rychlejšímu získávání dat.

Kniha není překážka pokroku. Kniha je jedním z jeho základů. Bez knih by nebyla moderní věda, univerzity, občanská společnost, právní kultura ani kritické myšlení v podobě, jak je známe. Když dnes staré knihy řežeme kvůli modelům, které mají napodobovat lidské poznání, chováme se jako někdo, kdo pálí štafle, po nichž právě vyšplhal.

Umělá inteligence může být nástrojem poznání. Ale pokud její vývoj začne pohrdat tím, z čeho poznání vyrostlo, stane se spíš nástrojem zapomnění. Ne proto, že by neuměla pracovat s textem, ale proto, že by se ztratila úcta ke zdroji.

Závěr: budoucnost nesmí vznikat ničením paměti

Příběh o ničení knih pro trénování AI je víc než epizoda z technologického průmyslu. Je to varování. Ukazuje, jak snadno může civilizace zaměnit moudrost za data, kulturu za obsah a dědictví za surovinu. Ukazuje, jak rychle se může z hesla „urychlit inovace“ stát omluva pro jednání, které by nám v jiném kontextu připadalo barbarské.

Staré knihy nejsou posvátné proto, že by se jich nesměl dotknout skener. Jsou posvátné v širším lidském smyslu: protože nesou paměť. Protože připomínají, že poznání nevzniká okamžitě, ale pomalu. Že lidé před námi bádali, psali, přepisovali, opravovali, tiskli, četli a uchovávali. Že kultura je řetěz důvěry mezi generacemi.

Pokud má být AI součástí dobré budoucnosti, musí tento řetěz prodlužovat, ne přetrhávat. Musí pomáhat knihy zpřístupňovat, ne je ničit. Musí respektovat autory, ne je obcházet. Musí spolupracovat s knihovnami, ne se chovat jako těžařská společnost v krajině lidské paměti.

A my jako společnost bychom měli trvat na jednoduché zásadě: žádná technologie není tak pokročilá, aby ji omlouvala neúcta k tomu, z čeho sama čerpá.


⚠️ Důležité upozornění: Tento článek byl vytvořen za pomoci AI COPILOT

Použité zdroje informací

  1. Ashley Belanger: Booksellers suspect AI firms are buying and then destroying rare books, Ars Technica, 12. srpna 2026. [arstechnica.com]
  2. Wendy Hanamura: Meet Eliza Zhang, Book Scanner and Viral Video Star, Internet Archive Blogs, 9. února 2021. [blog.archive.org]
  3. Internet Archive: Eliza Digitizing a Book, video a popis procesu nedestruktivního skenování knih. [archive.org]
  4. U.S. Copyright Office Fair Use Index: Bartz v. Anthropic PBC 787 F. Supp. 3d 1007 (N.D. Cal. 2025), shrnutí rozhodnutí k fair use a AI tréninku. [copyright.gov]
  5. Robert D. Carroll, Timothy Keegan, Eunbi Choi: District Court Issues AI Fair Use Decision: Using Copyrighted Works to Train AI Models Is Fair Use, but Using Pirated Copies to Build a Central Library Is Not, Goodwin, 25. června 2025. [goodwinlaw.com]
  6. Samantha Cole: Company Offering Printed Books to Train AI Stops After 404 Media Coverage, 404 Media, 31. července 2026. [404media.co]
  7. Scott Young: Harvard’s Library Innovation Lab launches Institutional Data Initiative, Harvard Law Today, 12. prosince 2024. [hls.harvard.edu]
  8. Kate Knibbs: Harvard Is Releasing a Massive Free AI Training Dataset Funded by OpenAI and Microsoft, WIRED, 12. prosince 2024. [wired.com]

Napsat komentář