根據外媒《404 Media》最新調查披露,一筆高達上千本的珍稀書籍訂單中,被巧妙地植入了一枚蘋果AirTag追蹤器。這枚追蹤器穿越美國數州,最終定位在亞馬遜位於內華達州的「LAS8」秘密倉庫,揭開了一條以破壞性銷毀書籍、將其轉化為AI「數據飼料」的隱密供應鏈。當科技巨頭為了訓練大語言模型而榨取實體藏書,我們失去的可能不只是紙本,而是人類文明的實體憑證。
AirTag追蹤實錄:從書本夾層到「VGT3」碎書流水線
這起調查的起點,是《404 Media》與一位珍稀書籍賣家的跨界合作。調查團隊在出貨的一千本珍貴藏書中,將一枚AirTag隱藏在書本夾層,展開長達數週的物流追蹤。訊號顯示,這批文獻從加州出發,中途經過密爾瓦基、科羅拉多州的大章克申,最終抵達亞馬遜位於拉斯維加斯東北部、代號為「LAS8」的大型物流倉庫。
問題來了:一個以按需印刷服務為公開業務的倉庫,內部卻藏著完全相反的破壞性作業。「LAS8」內部有一個標記為「VGT3」的管制區域,那裡的珍稀書籍面臨的是一套標準化處置流程:工作人員用專業切紙設備切斷書脊,將書籍解體為零散紙頁,再送入工業級高速進紙掃描儀進行全自動光學掃描。根據《404 Media》取得的內部作業影像,整個過程如同一條高速運轉的拆解流水線,書籍從完整到只剩碎紙,不過是幾分鐘的事。
這些被數位化的文字,既不會上架供大眾借閱,也不會製作成電子書版本。它們的去向只有一個:作為預訓練演算法的專屬飼料,直接灌入大語言模型的底層數據集。一旦文字價值被徹底榨乾,殘存的物理碎紙與封皮便被當作廢棄物丟棄。
編輯觀點:這不是圖書館的數位化典藏,這是一場對實體文明的掠奪式開採。從產業面來看,科技巨頭正在用資本重新定義「知識的價值」——一本書的內容被萃取後,載體本身即被視為無用垃圾。但我們該思考的是:當AI能夠讀取所有文字,卻無法理解一本書在歷史長河中的物質意義時,我們究竟是在訓練智慧,還是在製造一座巨大的、沒有溫度的數據墳場?法律或許允許,但文化倫理顯然還沒跟上。
為什麼要「毀書取字」?AI資料荒背後的模型崩潰危機
科技巨頭之所以採取如此極端的手段,核心癥結在於當前AI產業遭遇的嚴重資料荒。隨著網路上充斥大量由AI生成的合成內容,AI開發商正面臨一個技術瓶頸:當大型語言模型反覆使用AI生成的資料進行訓練,會引發所謂的「模型崩潰(Model Collapse)」效應。
根據多位AI研究機構的警告,模型崩潰會導致輸出的內容日益同質化、平庸化,甚至喪失邏輯推理能力。同時,合成資料還會成倍放大AI的「幻覺(Hallucination)」問題,使錯誤資訊在遞迴訓練中被強化為虛假的事實基準。白話一點說:如果AI開始吃自己拉的資料,它最終會產出一個空洞、重複且缺乏原創性的數位怪物。
打破這種數位污染的惡性循環,需要海量真實、獨特且從未被AI污染過的人類原創內容。而尚未被數位化的實體書籍——特別是那些保留純粹人類智慧的古老藏書——因此成為科技公司眼中「未污染的黃金礦脈」。
合法但野蠻:合理使用條款下的文化浩劫
在法律層面上,目前美國法院的司法判例傾向於將此類操作認定為「合理使用」範疇內的合法行為。前提是科技企業並未將這些未經授權數位化的書籍副本公開發行或轉售牟利,而是僅作為訓練演算法的內部參數分析。事實上,採取這種破壞性掃描策略的並非只有亞馬遜一家。根據《404 Media》的調查,包括知名AI獨角獸Anthropic在內的多數大型商業AI研發機構,也早已加入搶購實體書籍並進行內部訓練的行列。
但法律的許可,並未能平息文化界的巨大焦慮。業內專家與文史學者沈痛警告,實體書籍的存量終究有限。隨著科技巨頭無止境地消耗這些資源,部分存世量極少的絕版書與地方文獻,極有可能在這場「先拆書、後銷毀」的AI軍備競賽中,徹底在物理世界絕跡。
想像一下:一本十七世紀的地方誌、一套僅存三本的原版醫學圖鑑,它們的內容或許被AI吸收了,但那本書本身——那個承載著裝幀工藝、藏書印記、歷史手稿氣味的物體——將永遠消失。我們訓練出的AI可能知道書裡的所有單字,卻永遠無法「讀懂」那本書作為一個歷史物件存在的意義。
當AI饑渴吞噬實體文明:我們還能留住什麼?
這起事件的荒謬在於:我們正在摧毀實體文明,來餵養一個沒有實體需求的數位神明。AI不需要書的紙張、不需要封面設計、不需要藏書票上的手寫名字——它只需要文字。但對人類而言,書籍從來不只是文字載體。它是一個時代的工藝、一段記憶的錨點、一種與過去握手的物理方式。
回到AirTag追蹤的起點。那枚追蹤器之所以能從加州一路追到內華達,是因為它藏在一本實體書的夾層裡。諷刺的是,正是這個物質載體,讓真相得以被揭露。如果所有書籍都被數位化、實體被銷毀,未來我們還能用什麼來追蹤知識的去向?還是說,未來的歷史學家只能透過AI的輸出,來推測我們曾經擁有過什麼?
根據業界估算,AI產業對於高品質、未污染文字數據的需求,在未來三到五年內仍將持續攀升。而實體書籍的存量,特別是具有獨特知識價值的絕版文獻,正在以無法逆轉的速度消耗中。這不是一個漸進的過程,而是一場正在進行中的文明快轉。
數據背後的啟示
這起調查帶給我們的,不只是一則科技醜聞,而是一道價值選擇題:我們是否願意用實體文明的存續,去交換一個演算法的進化?法律上,亞馬遜與其他科技巨頭的行為或許站得住腳;文化上,我們正在目睹一場無聲的掠奪。AI的訓練需求是真實的,但解決資料荒的方式不應該建立在破壞人類共同遺產之上。
目前,美國文化機構與圖書館界已開始呼籲建立「AI訓練用書籍的合法數位化授權機制」,讓書籍內容能夠被掃描使用,同時保留實體書籍的存續。這或許是一個折衷方向——但在機制建立之前,每一本被送入「VGT3」的珍稀書籍,都將是最後一次以實體形式存在於世界上。
如果你是藏書家、文史研究者,或只是個喜歡紙本書的人,這則新聞不該只是看過就忘的科技花邊。它關乎我們如何定義知識的價值,也關乎我們想留給下一代什麼樣的文明線索。別等AI替我們寫歷史——因為它寫的,永遠不會是完整的版本。
本文改寫整理自公開新聞來源,原始報導由T客邦發布。
常見問題 FAQ
亞馬遜「LAS8」倉庫的毀書行為是否違法?
根據目前美國法院的司法判例,此類操作在「合理使用(Fair Use)」範疇內被認定為合法,前提是企業未將數位化內容公開發行或轉售,僅作為內部AI訓練使用。
什麼是「模型崩潰(Model Collapse)」?
模型崩潰是指當大型語言模型反覆使用AI生成的合成資料進行訓練時,會導致輸出內容日益同質化、平庸化,甚至喪失多樣性與邏輯推理能力的技術現象。
為什麼AI公司不直接使用已數位化的電子書?
因為市面上多數電子書與網路文本已大量混雜AI生成內容,被視為「污染數據」。未經數位化的珍稀實體書籍被認為保留純粹人類原創內容,是AI訓練所需的「未污染黃金礦脈」。
一般民眾可以如何關注或避免這類文化損失?
建議關注美國圖書館協會等文化機構推動的「AI訓練用書籍合法數位化授權機制」倡議,並支持實體書籍保存計畫;在消費層面,選擇支持開放授權或明確AI使用條款的出版品,也是間接監督的方式。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。