S2E68 AI 巨頭的秘密:偷買二手書,掃描完就銷毀 Why?

August 23
18 mins

View Transcript

Episode Description

👉 矽谷輕鬆談專屬優惠連結:https://nordvpn.com/jktech

訂閱即額外多送 4 個月|30 天退款保證


#NordVPN


🔒 本集節目由 NordVPN 贊助


根據內政部 165 打詐儀表板,詐騙件數第一名的類別是「網路購物」。社群上那些限時特價的一頁式廣告,做得跟官方商店一模一樣,用完就丟、換個網域再開,讓你根本學不會怎麼認出它。NordVPN 內建的威脅防護會在你連上這些網站之前就先擋掉,釣魚連結、惡意網站都在源頭自動處理,不用你自己判斷。


有興趣的朋友透過上方矽谷輕鬆談的專屬連結試試看,訂閱額外多送 4 個月,30 天不滿意直接退,完全沒有損失。


如果你喜歡我的內容,歡迎加入會員支持我,讓我把內容做得更深、做得更好,一起把這個頻道做成我們都想看到的樣子!

👉 https://www.youtube.com/channel/UCJIPFjZSCWR15_jxBaK2fQQ/join


你有沒有想過,現在網路上大概每三個網頁就有一個帶著 AI 處理過的痕跡,而且只會越來越多。所以對這些模型商來說,2022 年 ChatGPT 出現以前、還沒被 AI 污染過的資料,突然變成一種稀缺資源。而他們的解法蠻粗暴的,就是直接去二手書市場大量收書,掃描,然後銷毀。


Anthropic 在 2024 年偷偷啟動了一個叫巴拿馬計畫的東西,內部文件寫得很直接,要大規模掃描全世界的實體書,而且不能被其他人發現。很多人以為是為了乾淨資料,其實他們一開始的動機是版權。至於他們試過買數位版、也試過一家一家去談授權,最後為什麼還是回去走這種土法煉鋼的路,我在影片裡講。


更好笑的是 Amazon。一開始是二手書商發現怎麼一直有來路不明的大單,一筆下去可能就是他們一週的營業額,而且每次買家還都不太一樣。後來一個 404 Media 的記者乾脆在書裡縫了 AirTag,一路追到拉斯維加斯的一個 Amazon 倉庫,代號 VGT3,倉庫 logo 是一隻恐龍抓著書在啃。他們掃書還有個規矩,只買沒重複過的 ISBN,連市面上剩沒幾本的珍本都照掃照毀,也難怪社群上反彈這麼大。


很多人把這件事類比成焚書坑儒,但我覺得性質不太一樣,秦始皇是不想讓知識傳出去,這些公司是想把知識鎖進自己的資料庫裡。至於掃描完為什麼不乾脆賣回去、非得銷毀不可,我自己歸納出三個理由,一個最直接跟成本有關,一個跟法律有關,還有一個就比較不能明講了。


不過拿到乾淨資料就贏了嗎?我覺得是也不是。這招在 2023 年很成立,但 scaling law 後來慢慢撞牆,大家才轉去做強化學習跟推論時的運算。有趣的是這條路也有它的代價,模型在能被驗證的程式、數學上越來越強,可是在沒辦法量化的語感上反而退步了。我前陣子換到 Opus 5 之後真的很煩躁,每個字我都看得懂,連起來卻不知道它在公三小,一度還懷疑是不是自己腦霧,後來才發現不是我的問題,是模型的問題。


最後我聊了一個反過來的角度。當這些公司拼命想餵乾淨資料的同時,也有人正花大錢想餵髒的。以色列政府花了 90 萬美金請公關公司做了一個看起來很中立、有引用有註腳的假智庫網站,目的就是讓你問到以巴衝突的時候,ChatGPT 或 Gemini 會引用到他們的觀點。還有一種更難防的,是網站裡藏一些你看不到的字,等你請 AI 幫你摘要,那些字就悄悄把某些想法寫進 AI 給你的答案、甚至你的個人記憶裡。


所以在這個時代,你還敢全信 AI 講的每一句話嗎?看完歡迎在下面留言告訴我。


🔗 《矽谷輕鬆談》傳送門 👉 https://linktr.ee/jktech


(00:00) 開頭:AI 公司正在偷買二手書,掃描完就銷毀

(01:01) 最近讓我最有感的防詐工具

(02:26) 2022 年以前的書,為什麼變成 AI 最想要的資料

(02:56) Anthropic 的巴拿馬計畫:為了版權,偷偷掃描全世界的書

(04:52) Amazon 也在幹一樣的事:記者用 AirTag 抓到吃書恐龍倉庫

(06:30) 這不是焚書坑儒,是知識私有化

(07:51) 掃完為什麼不賣回去,非得銷毀?三個理由

(09:14) 拿到乾淨資料就贏了嗎,其實沒那麼簡單

(11:05) 岔題吐槽:Opus 5 的語感到底怎麼了

(12:42) 從 test-time compute 到持續學習與 RSI

(15:04) 換個角度:有人反而想幫 AI「下毒」

(15:50) 看不見的隱藏字,怎麼悄悄污染你的 AI

(17:14) 結尾:戶外聊天這個形式,你們喜歡嗎

See all episodes