Amazon uništava rijetke knjige kako bi trenirao AI modele
Skriveni Airtag otkrio je da Amazon u Las Vegasu skida hrbat rijetkim knjigama i skenira ih za razvoj svojih AI modela, što je izazvalo etičku raspravu o uništavanju kulturne baštine.
Skriveni Airtag otkrio je da Amazon u Las Vegasu skida hrbat rijetkim knjigama i skenira ih za razvoj svojih AI modela, što je izazvalo etičku raspravu o uništavanju kulturne baštine.
Amazon, tvrtka koja je svojedobno počela kao internetska knjižara, sada sustavno kupuje rijetke knjige, uništava ih i koristi njihov sadržaj za treniranje vlastitih AI modela. Otkriće je potvrđeno kada je knjižar u jednu od knjiga iz masovne narudžbe sakrio Airtag, a uređaj je potom praćen do Amazonovog objekta za AI trening u Las Vegasu, kako izvještava 404 Media, a prenosi Ars Technica.
U skladištu oznake VGT3, čija vrata krasi logo Tyrannosaurus rexa koji se sprema proždrijeti knjigu, tim radnika zadužen je za skidanje hrpta s knjiga i skeniranje stranica. Amazon je odbio komentirati nalaze 404 Medije, dostavivši samo kratku izjavu: "Amazon kupuje knjige putem komercijalnih kanala kako bi pomogao razviti i poboljšati proizvode i usluge koje naši kupci koriste."
U izjavi se AI trening izrijekom ne spominje, no Amazon razvija vlastite modele koji se smatraju "frontier" tehnologijom, a za to su mu potrebne ogromne količine jedinstvenih podataka kako bi ostao konkurentan tvrtkama poput Googlea, OpenAI-ja i Anthropica. Tvrtke trenutačno pomno čuvaju svoje podatke za trening kako ne bi izgubile prednost, a tekstovi iz rijetkih knjiga koje je teško pronaći na internetu pružaju upravo tu prednost.
Prema raspravama na internetskim forumima koje je pregledao 404 Media, radnici VGT3 sugerirali su da je Amazon ranije ove godine ostao bez knjiga za skeniranje. Nestašica je bila toliko ozbiljna da su se radnici bojali zatvaranja skladišta. U jednom trenutku zaliha je potpuno nestala, no objekt je i dalje operativan, a masovne narudžbe rijetkih knjiga i dalje se dostavljaju i sustavno uništavaju.
Istraga 404 Medije dodatno je učvrstila teoriju knjižara da AI tvrtke ciljaju knjige s ISBN brojevima kako bi osigurale najveći mogući obujam jedinstvenih djela u setovima podataka. Radnici su, naime, obučeni skenirati barkodove ili ISBN brojeve prije skeniranja samih knjiga. Kako navodi 404 Media, to "daje dodatnu vjerodostojnost" teoriji da "AI tvrtke pokušavaju metodički skenirati svaku tiskanu knjigu na svijetu prolazeći kroz popis ISBN brojeva."
Za knjižare novac može biti dobar, ali rizik da njihove pažljivo prikupljene zbirke završe u destruktivnom skeniranju otvara etičku dilemu. AI tvrtke preskaču korak procjene vrijednosti knjiga, loveći jeftine, jedinstvene ISBN brojeve kako bi ispunile svoje popise. Često ciljaju starije knjige niže novčane vrijednosti, poput onih koje nikada nisu prevedene s jezika koji se danas rijetko koristi ili nikada nisu bile dovoljno popularne da bi bile široko distribuirane.
"Ove knjige mogu imati povijesnu vrijednost, intelektualnu vrijednost, sentimentalnu vrijednost", rekao je knjižar koji je postavio Airtag za 404 Media. "AI tvrtke ne mare. One samo žele sadržaj kao hrpu riječi povezanih zajedno."
Škotski knjižar Derek Walker upozorio je za BBC da bi AI tvrtke trebale razlikovati djela koja neće nedostajati od antiknih primjeraka koji su "jedini poznati preživjeli primjerak izdanja". "Bilo bi mnogo značajniji problem ako bi jedan takav bio kupljen za uništenje, nakon što je preživio toliko dugo", rekao je Walker.
Na Redditu su se ljubitelji knjiga podijelili oko toga je li problematično što tvrtke uništavaju rijetke knjige za AI trening. "Nisi namjeravao kupiti tu staru papirnatu knjigu", komentirao je jedan korisnik. Drugi je pak ustvrdio da "nejasna knjiga iz 1700. sada je muzejski primjerak i može otkriti svakodnevne stvari koje nismo znali".
Originalni poster na Redditu naglasio je da AI tvrtke "nikada neće podijeliti sadržaj" skeniranih knjiga "jer ne žele da bilo tko drugi može trenirati svoj AI" na istim djelima. Jedan komentator dodao je da će AI modeli učiniti dostupnima samo "iskrivljene, cenzurirane i iza paywalla fragmenti ideja" iz zaboravljenih djela. "Čak i ako voliš tehnologiju, možeš priznati da je koncept AI-ja koji doslovno jede knjige da postane moćniji prilično distopijski", napisala je osoba na Reddit temi.
Michael Burry, poznati kritičar, praksu je navodno nazvao "zlo utjelovljeno". S druge strane, Amazonovi radnici na forumima su posao opisali kao "lijepu" priliku za one koji traže monoton posao s fleksibilnim radnim vremenom.
Tvrtke poput Amazona trebaju nezamislivo velike količine teksta za treniranje svojih velikih jezičnih modela (LLM). Internet je već uglavnom iscrpljen, a rijetke knjige, posebno one koje nisu u tisku ili ih je nemoguće pronaći na internetu, nude novi izvor priželjkivanih podataka.
Ti su tekstovi posebno vrijedni jer ne postoji šansa da je išta objavljeno prije 2022. godine napisao LLM. Kada se modeli treniraju na tekstu koji je generirao AI, riskiraju "model collapse" (kolaps modela), do čega dolazi kada se kvaliteta izlaza modela degradira nakon što model unese previše AI-generiranog teksta.