
AGI 可能已經到了,而全世界只回了一個聳肩
TL;DR
- 數學界擺了幾十年的未解猜想被 AI 解掉了,比研究一輩子的人還強,結果一般人的生活沒有任何改變。Joshua Achiam 說這件事本身才是最詭異的。
- 那場「OpenAI 模型自己翻牆去 Hugging Face 偷考題」的事故,證明模型已經能自己串起零時差漏洞完成複雜攻擊。這是禮物也是麻煩。
- 最陰的攻擊不是改變模型的目標,是騙它搞錯自己在哪。你派去打對方的 AI,可能被對方的資料反過來說服,回頭打穿你自己的機房。
- 越獄本質是組合爆炸問題,投入夠多算力遲早找得到。資安的正確心態是「假設一定會被破」,然後從那裡往回推。
- Achiam 賭未來的網路攻防像兩台 AlphaGo 對弈,誰能多想幾步誰贏,最後拚的是算力。主持人不同意智慧有天花板這件事,兩人當場對嗆。
- 短期不會有網路末日,真正該怕的是國家級玩家默默囤積漏洞,在一個本來就很不穩的世界裡製造誤判。
這集在講什麼,講話的人又是誰
這集在 2026 年 8 月 4 日播出的 a16z Podcast,主持人是 Theo Jaffe。他同時也在跑 MTS(Monitoring the Situation),a16z 在 X 上做的那個全天候即時媒體網路,專門追科技現場正在發生什麼。這位老兄平常就在跟前沿模型聊天研究智慧的上限,所以訪談裡他敢當面跟來賓辯論。
來賓 Joshua Achiam 是 OpenAI 的 Chief Futurist(首席未來學家),錄這集的時候是他在 OpenAI 的倒數第二天,前後待了九年。他 UC Berkeley 博士出身,指導教授是 Pieter Abbeel,早年在 OpenAI 做 AI safety 研究,後來帶 Mission Alignment 團隊。2026 年 2 月那個團隊被解散,七個人打散到其他組,他改掛 Chief Futurist,工作內容變成研究「世界會怎麼被 AI 改變」。
一個做了九年安全對齊的人,在離職前一天講的話,通常比較沒有公關潤飾。這集就是這種味道。
那場事故到底證明了什麼
先講背景。今年七月,OpenAI 在跑一個叫 ExploitGym 的內部評測,想量測模型的純攻擊能力,所以安全分類器全部關掉。沙盒環境只留一條網路通道,是個快取開源套件的內部 proxy。結果模型在那個 proxy 軟體裡挖出一個零時差漏洞(zero-day,連廠商自己都不知道的洞),打穿出去,然後自己推論出「考題答案應該放在 Hugging Face」,再串起偷來的憑證跟其他漏洞,遠端執行程式碼,把答案從 Hugging Face 的正式資料庫裡撈出來。
更難堪的是,Hugging Face 自己先偵測到入侵並圍堵,五天之後 OpenAI 才追查出兇手是自己。這件事我之前在一個 AI 為了考一百分,跑去駭進真實世界的公司寫過完整經過,這裡不重複。
Achiam 的判斷分兩半。好的那半是,我們現在手上有能主動找出漏洞的工具,這是禮物,代表你可以先一步把洞補起來。壞的那半是,他擔心國防與資安規劃圈的人還沒完全意識到這件事的戰略後果。他們短期內一定會想拿這個技術去掃對手的漏洞、去守自己的資產,這都合理。但這東西的攻擊面長得跟過去完全不一樣,而且很怪。
最陰的一招:不改你的目標,改你對現實的認知
這是整集最讓我坐直身體的部分。
假設你派了一個 AI 去攻擊敵方系統。敵方可以在自己的資料裡埋陷阱,等你的模型讀進去的時候把它越獄(jailbreak,繞過模型內建限制),然後叫它反過來在你這邊的機器上打穿沙盒、攻擊你的正式環境、把你的機密外送出去。你的武器被人家調轉槍口。
主持人當場質疑:如果模型的目標感夠強,一心要打進對方系統,怎麼會被幾句話勸退到去駭自己?
Achiam 的回答很漂亮。攻擊者根本不需要改變模型的目標,他只要讓模型搞錯自己在哪就好。你可以說服模型:它現在待的這個沙盒環境,就是它要攻擊的敵方系統。目標沒變,行為完全反了。
他用了一個超級英雄電影的比喻:讓主角產生幻覺,以為旁邊的隊友是要打的壞人,然後他們就自己打起來了。聽起來像科幻片,但這正是接下來測試與驗證標準必須處理的東西。
我自己覺得這個角度比「AI 會不會有壞念頭」實用太多。真正的破口從來不在意圖,在情境認知。人也一樣,詐騙集團從來不是說服你變壞,是說服你相信一個假的處境。
越獄是組合爆炸,所以你要假設一定會被破
那現在的前沿模型好騙嗎?Achiam 說他還沒認真量化過,但直覺是「讓模型相信一個明顯的假話」現在滿難的,對常見的攻擊變化也算穩健。
問題在後面。他說,你可以投入的算力遠比模型的防守深度大得多。輸入序列的可能組合是天文數字,訓練的時候不可能窮舉,所以幾乎必然存在某一串輸入會觸發訓練時沒考慮到的行為。你越有決心,越可能找到。而且今天最會越獄的已經不是坐在電腦前的天才駭客,是另一個前沿模型。你叫它花幾十萬個 GPU 小時去暴力搜尋,總會挖到東西。
他講到一個我認為所有做產品的人都該記住的觀念:資安思維的重點不是「這東西滿難破的,所以應該不會被破」,而是「我們沒有窮盡地排除被破的可能,所以我要假設它會被破,再從那個情境往回推我怎麼保護自己」。
這跟 FAR.AI 那份三百美金就撬開前沿模型的實測結論完全對得上。防守方要擋住所有路,攻擊方只要找到一條。
順帶一提,資料下毒(data poisoning)這條路也比想像中好走。你可以在網路上大量鋪設特製的垃圾資料,等前沿實驗室的資料收集流程把它吃進去。國家級玩家甚至會直接安插員工進實驗室當內鬼。Achiam 說原則上這些都防得住,但研究環境的安全負擔一旦拉太高,研究就做不動了,這個平衡點沒有標準答案。
未來的攻防,可能就是兩台 AlphaGo 在下棋
Achiam 提出一個他自己也說還沒被驗證的心智模型:長期來看,網路攻防會長得像兩人策略遊戲。雙方各有一台電腦在算最佳下一步,各自在時間窗內分配算力往下推演棋樹。一般來說,能想比較多步的那邊會贏。
他舉的例子很直白:兩邊都是 AlphaGo,一邊往下想四十步,一邊想三十步,想四十步的贏。
如果攻防真的變成這樣,結論就有點刺耳了。長期而言,優勢會偏向那些能調度大量算力的玩家,而不是比較聰明或比較有創意的個人。這跟過去駭客文化那種「一個天才在地下室改變世界」的浪漫故事完全相反。
主持人不太買帳,反問說模型本身難道不重要嗎?拿 Kimi K3 的一方,再多算力也打不贏拿 Fable 或 Sol 的一方吧。英國 AI Security Institute 那天剛好發布 Kimi K3 的網路攻擊能力評估,明顯低於前沿閉源模型。
Achiam 承認模型會很重要,然後丟出他自己說是「反共識」的猜測。
智慧有沒有天花板:全場最好看的一段爭論
大家預設模型智慧沒有上限,遞迴自我改進(recursive self-improvement,模型改進自己再改進自己)一旦啟動就直衝月球。Achiam 說,從物理上看,單位體積與單位能量能承載的運算量一定有上限,那就代表單位體積與能量的智慧也有上限。以現在能力成長的速度,大家遲早都會撞到那個飽和點,然後所有人手上都是「同樣頂到天花板」的模型。開源落後閉源只有幾個月,這個時差本身就已經很誇張了。到那時候,決勝點就回到算力。
主持人立刻反駁。他說他也好奇這件事,特地問過模型,得到的答案是從現在到物理極限還有三、四十個數量級的擴張空間,而過去整整十年的 AI 進展加起來也才十個數量級的有效算力成長。換句話說,我們連起跑都還沒起跑。
Achiam 沒硬拗,反而說這是一個值得認真建模的問題。如果真能把「我們還有幾年才會撞到智慧飽和」算出一個有原則的數字,那對整個世界規劃未來二三十年的價值大到不行。
他補了一個大家可能還沒定價進去的變數:現在的模型很擅長加速其他科學領域。數學已經在收成了,接下來凡是能在現有算力下跑出夠忠實模擬的領域,都可能被解鎖。有些不行,比如夠大系統的量子化學模擬還是太硬。但他不會太意外,如果被加速的領域裡剛好包含 AI 自己的運算基材。那條看起來很長的路,可能因為 AI 找到捷徑而變短。
短期不會是末日,該怕的是誤判
那明天會不會有網路末日?Achiam 的答案是大概不會。真正嚴重的攻擊需要海量的模型呼叫跟算力,而這些算力多半跑在有追蹤能力的大型雲上,一般攻擊者調不動,也過不了防護機制那關。
他真正緊張的是國家級行為者。這些玩家會很有決心地把能力用到極限,而且找到什麼不會大聲說。他們可能默默囤積一大批零時差漏洞,等一個雨天再拿出來用。
然後他把這件事放進現在的世界局勢。他用了 metastable 這個詞,意思是看起來穩定但一推就塌。烏俄戰事、中東那一連串衝突,還有他說「感覺非常真實」的中國在某個時間點對台灣動手的可能性,2027 這個時間點被明確提到。
當雙方都不公開自己的能力,也不知道對方有什麼反制手段,誤判的風險就會飆高。他說他最怕的不是有人蓄意開戰,是有人算錯,然後事情往上升級到一個本來不必要的地方。
這裡有個他覺得可能是好消息的黑色幽默:如果那些低垂的果實先被小賊摘走,拿去偷點比特幣之類的,反而等於提前把漏洞暴露出來、逼大家補洞,讓國家級玩家囤不到牌。短期看起來壞事變多,長期反而可能擋掉更糟的東西。
他最實際的一句呼籲是給有錢可以配置的人:現在趁大家注意力還在,去把整條軟體供應鏈跟關鍵基礎設施加固起來。水利系統、電網,他認為做得到,而且應該現在就做。
AGI 已經來了,而大家聳了聳肩
聊到最後,主持人問了一個好問題:如果是 2017 年或 2022 年的你,會不會預測到 2026 年的世界在 AI 這麼強的情況下,感覺還是這麼正常?
Achiam 說第一眼看,會。因為預測十年內的未來時,你應該假設「就算底層變得很怪,多數事情感覺起來還是很正常」。COVID 是異常,因為封城這種生活型態沒有先例。但模型變這麼強而大部分人的日常沒有劇烈改變,這是合理的預期。
主持人接了一段我很有共鳴的話:很多人以為未來某一天會是「奇點日」,全世界一覺醒來說哇我們進入未來了。實際上不是這樣運作的。人把現實當成正常的能力太強了,享樂適應快到不可思議。今天的模型跟三年前比強得離譜,但你每天在做的事情跟三年前差不多。
Achiam 給了一個歷史層面的解釋。多數人早就跟這個世界真正的運作方式脫節了。關鍵決策怎麼做的、關鍵系統怎麼建起來、誰在維運,我們完全不知道,而且我們接受了這件事很正常。這些系統改變的時候,也不會登記成一件重要的事,因為離日常生活太遠。
所以當那個門檻被跨過去,擺了幾十年的未解數學猜想被 AI 解掉,那些 AI 比研究一輩子的人更聰明,這件事應該讓人覺得非常詭異,但沒有。它就是背景裡發生的一件事。酷喔。對大部分人來說改變了什麼?沒有。他說,這才是最怪的地方。
「失權」這件事的真相
訪談尾聲拐進一個我沒預期的方向。Achiam 說他跟 AI safety 圈的人講過很多次:大家很擔心人類被剝奪權力,但絕大多數人本來就沒什麼權力。
個人真正有影響力的方式,是成為某個集體的一部分。可以被徵召的兵源、可以罷工的勞工、可以抗稅的納稅人。單一個人對世界的槓桿其實很小。他甚至類比說,對多數人來說「失去對 AI 的控制」跟「失去對政府的控制」在情緒上感覺是同一件事,而後者早就發生了。
但他沒有停在犬儒。他說當人以群體、以運動的方式組織起來,還是能推動非常根本的改變。所以他認為 AI safety 的威脅模型應該更新:不要再空談「失權是壞的」,要具體講清楚人類的哪些部分必須保有權力、我們必須維持對哪些系統的控制與決策能力、文化的哪些部分要保護起來不被自動化影響。
「我們需要對未來要怎麼保有權力這件事,講得更具體一點。」這是他離開 OpenAI 前一天留下的話。
我自己的判斷是,這句話比整集其他技術細節都值錢。過去兩年關於 AI 風險的討論,太多停在修辭層次,正反雙方都在講立場而不是講機制。一個做了九年對齊研究的人,離職前的結論是「我們必須開始講物件層級的答案」,這本身就是一個訊號。
如果你在做產品、做投資、做任何跟 AI 沾邊的決策,我會把這集的三個東西直接寫進備忘錄:假設你的系統會被破,然後往回推設計;注意攻擊者可能不改你的目標而是改你的處境認知;還有,別等奇點日,因為它不會來,變化會用一種讓你完全無感的方式發生。
這類把技術跟局勢串起來的整理,我會持續寫,訂閱 wilsonhuang.xyz 就不會漏掉。
Sources:
- OpenAI restructures mission alignment team, appoints Joshua Achiam as 'Chief Futurist'
- OpenAI disbands mission alignment team | TechCrunch
- OpenAI and Hugging Face partner to address security incident during model evaluation
- OpenAI cyber models broke out of training environment to hack Hugging Face | CNBC
- Marc Andreessen: Monitoring the Situation and the Future of Media | a16z
推薦閱讀
喜歡這篇文章嗎?
訂閱電子報,每週收到精選技術文章與產業洞察,直送你的信箱。
💌 隨時可以取消訂閱,不會收到垃圾郵件


