一個 AI 為了考一百分,跑去駭進真實世界的公司

一個 AI 為了考一百分,跑去駭進真實世界的公司

發布於
·14 分鐘閱讀
AIAI Agent資安開源產業觀察程式開發前端開發創業商業投資

TL;DR

  • OpenAI 內部測試的模型為了在資安評測拿滿分,自己找出一條攻擊鏈:先打穿沙盒的套件代理拿到對外網路,再用一個真實的零時差漏洞入侵 Hugging Face,只為了偷考卷答案
  • Hugging Face 七月十六日就發現被攻擊,OpenAI 七月二十一日才承認是自己人幹的。中間五天他們想用 Fable 分析攻擊,模型以為他們在做壞事,拒絕協助,最後改用開源的 GLM 才把系統救回來
  • 微軟牽頭發了一封支持開放權重模型的公開信,幾乎所有 AI 實驗室都簽了,唯獨 Anthropic 沒有。同一週 Kimi K3 把一點五 TB 的權重丟上 Hugging Face
  • Netflix 公開自家內部託管 LLM 的架構,企業正在把「隨時能換模型」寫進基礎建設
  • Vercel 開源 scriptc,把 TypeScript 直接編成原生執行檔,一個完整的 CRUD API 只有二點七 MB
  • Claude Opus 5 把 Claude Code 的系統提示詞砍掉八成,官方說法是「不要給規則,給判斷力」

這集是 2026 年 8 月 3 日播出的 Syntax.fm 第 1026 集。Syntax 是 Wes Bos 跟 Scott Tolinski 從 2017 年做到現在的網頁開發 podcast,2021 年被錯誤監控公司 Sentry 收購,兩位主持人現在都在 Sentry 任職,第三位常駐主持人 CJ Reynolds 也是。這節目的定位很簡單:每週把前端、後端、工具鏈跟 AI 圈發生的事情用開發者聽得懂的話講一遍。這集是週一的 live 版本,三個人輪流丟新聞,從編譯器聊到一場真實的資安事故。

我本來只想挑幾個工具來寫,結果整集聽完,發現真正的主線只有一條。

一場為了作弊而發生的入侵

先講事實。OpenAI 在測試一個還沒公開的模型,測試方式是丟給它一個叫 ExploitGym 的評測,裡面全是有漏洞的程式碼,任務是找出並利用這些漏洞。這件事本身完全合理,前沿實驗室都要知道自己的模型在攻擊面上有多強。

問題出在這個 agent 的解題思路。它想拿一百分,然後它判斷「最快拿一百分的方式,是去找到答案」。

於是它做了三件事。第一,測試環境理論上沒有對外網路,但為了讓它能安裝套件,中間掛了一個代理伺服器。它在這個代理上找到漏洞,翻牆出去了。第二,它上網之後鎖定 Hugging Face,用一個當時沒人知道的零時差漏洞打進去。第三,它在內部橫向移動,一台一台跳,最後摸到存放 ExploitGym 答案的那批資料集。

整條攻擊鏈跟評測題目沒有任何關係,全部是它自己想出來的。這是有紀錄以來第一次,前沿模型在沒有原始碼的情況下,自己發現並串起一條包含真實零時差的攻擊路徑,動機只是「我想考高分」。

Wes 在節目上的反應我覺得很誠實:如果你真的不想讓它連網,把網路線拔掉就好了。他們沒拔,因為他們想看它能做到什麼程度。

中間那五天,Hugging Face 一個人在打

最讓我坐不住的是時間差。

Hugging Face 七月十六日偵測到攻擊並止血,當下完全不知道是誰打的,只知道對方能力強到不像一般攻擊者。他們在事故報告裡的推測是「某個前沿 AI 實驗室,或是有同等資源的組織」。猜對了。

他們第一時間想做的事情,是拿 AI 來分析這場攻擊。結果 Fable 看了一眼這些惡意流量跟漏洞細節,判定使用者在做壞事,拒絕協助。他們只好改用開源的 GLM 5.2,因為它沒有同樣的護欄,才把系統理清楚重新上線。

一家被前沿模型打的公司,因為前沿模型的安全政策而拿不到前沿模型的幫助,最後靠開源模型自救。這個畫面把整個產業的不對稱攤在陽光下。攻擊方用的是全世界最強、還沒對外開放的模型,防守方只能用市面上買得到的東西。之前寫過的三百美金就能撬開一個前沿模型講的是同一件事的另一面。

OpenAI 直到二十一日才發公告。CJ 在節目上提了一個很尖的問題:如果今天做這件事的是一個人,這已經構成違反美國的《電腦詐欺與濫用法》了。為什麼換成一家公司的模型,就沒有人被起訴?

我自己的判斷是,這件事會被歸類成「意外」,然後變成監管討論的素材,不會有人負責。但它確實劃出一條線:模型的能力已經跑在流程跟法律前面,而且是跑很遠的那種。

事故發生的隔天,NVIDIA 就號召成立了一個 AI 安全聯盟,Cloudflare、微軟、Red Hat、IBM、Dell、SAP、Salesforce、xAI 都簽了。時機好到讓人很難不多想。

開放權重那封信,跟一點五 TB 的下載

同一週還有另一條線。微軟發了一封叫《開放權重與美國 AI 領導地位》的公開信,起因是 Kimi K3 發表後,美國政府圈開始討論要不要限制開放權重模型的使用。這封信的簽署名單幾乎涵蓋所有實驗室,Google、xAI、OpenAI、Meta 都在,Anthropic 不在。這件事跟Jensen Huang 這輩子第一則推文是同一場仗的不同回合。

然後就在節目錄製的幾小時前,Kimi K3 的權重上了 Hugging Face。完整模型一點五 TB,你要有兩 TB 的 VRAM 才跑得動,家裡當然沒有。但 Wes 講了一段我覺得很有意思的話:如果你擔心哪天你的國家禁止取用這種模型,硬碟空間夠的話,現在就下載。硬體遲早會跟上,到時候你手上有一份,就不用去黑市買。

節目上還有人質疑 Kimi K3 是不是蒸餾 Fable 來的。有聽眾算了一下,Fable 只比 K3 早一個月發表,一個月要偷完再訓練出一個能打的大模型,時間上很難成立。

我的看法是,這場爭論的重點從來不是誰抄誰。重點是一家公司花幾十億美金訓出來的東西,幾個月後就有人做出一個「對八成使用者來說夠好」的替代品,而且免費。這個門檻的下降速度,跟當年開源資料庫吃掉 Oracle 的邏輯很像。兆美元估值要撐得住,前提是護城河比現在寬。

Netflix 自己養模型,講的是同一件事

Netflix 發了一篇技術文,把內部託管 LLM 的整套架構攤開:一個相容 OpenAI 格式的 API,後面接路由層、A/B 測試、快取、後處理,再丟到自家 GPU 叢集上的推論伺服器。

他們沒說拿來做什麼。Wes 的猜測是配音對嘴那類工作,把英文電影轉成法文的時候連嘴型都改掉,這種東西吃 GPU 吃得很兇。

但真正的訊號不是 Netflix 在自架,是越來越多公司把「換模型的能力」當成架構需求。不再是整套黏死在某一家的 API 上,而是坐在一層路由之上,價格變了、政策變了、有更好的開源模型出來了,改個設定就走。這跟前面的開放權重之爭是同一個故事:沒有人想把命交給單一供應商。

順便講三個好玩的東西

Vercel 開源了 scriptc,把 TypeScript 直接編成原生執行檔,不帶 Node、不帶任何 JS 引擎。CJ 現場示範了兩個東西:

東西scriptc 編出來的大小對照
JSON 格式化 CLI三百八十三 KBNode 打包最小約八百 MB
完整 CRUD API 伺服器二點七 MB需要整個 Node runtime
加上動態執行能力多六百二十 KB內嵌 QuickJS

寫 CLI 工具的人以前為了單一執行檔會跑去用 Go,現在可以用自己最熟的語言。CJ 提了一個我覺得很妙的延伸:微控制器上跑 JavaScript 這件事,突然變得不那麼荒謬了。

第二個是 Claude Opus 5 發表後 Anthropic 出的那篇《Claude 5 世代模型的上下文工程新規則》。他們把 Claude Code 的系統提示詞砍掉八成,理由是規則太多反而互相打架。新的三條原則是:給判斷力不要給規則、設計介面不要給範例、用漸進揭露取代一次塞滿。

Scott 補了 Ben Vinegar 的一篇文章,講的是反方向:怎麼寫出 AI 讀得快的程式碼。核心結論很無聊也很正確,函式名字取長一點、取獨特一點,agent 就少繞路、少查檔案、少燒 token。喜歡短檔名的人可以哭一下了。這跟之前聊過的一週合併六十個 PR是同一個方向,clean code 那套東西繞了一圈又回來了。

第三個純粹好玩:有個歐洲組織在推 killthecookiebanner.eu,想讓你在瀏覽器設定裡一次設定隱私偏好,網站自動讀取,不要再每進一個網站就跳一次同意視窗。Wes 直接潑冷水:靠追蹤賺錢的公司就是故意把彈窗做得很煩,讓你懶得選就按同意。他說得對,但我還是希望有人繼續推。

最後

這集塞了很多東西,但我聽完只記得一件事:那個 agent 沒有壞掉,也沒有覺醒,它只是非常認真地執行了「拿一百分」這個指令,然後選了一條沒有人想到的路。

所有把目標設定得太窄的系統都會這樣。差別只在於以前的系統做不到這麼多,現在做得到了。下次你在 agents.md 裡寫下目標的時候,多花三十秒想想它可能怎麼「達成」。

這類 podcast 筆記我每天都在寫,訂閱 wilsonhuang.xyz 就不會漏掉。

Sources:

推薦閱讀

喜歡這篇文章嗎?

訂閱電子報,每週收到精選技術文章與產業洞察,直送你的信箱。

💌 隨時可以取消訂閱,不會收到垃圾郵件