他買了一張顯示卡,算力超過當年發明 Transformer 的整個團隊

他買了一張顯示卡,算力超過當年發明 Transformer 的整個團隊

發布於
·13 分鐘閱讀
AI開源產業觀察投資VC創業半導體商業產品美股

TL;DR

  • Transformer 論文共同作者 Łukasz Kaiser 認為:AI 現在的權力集中是「當前技術的性質」,不是 AI 這件事的本質。
  • 沒有研究突破的時候,大公司唯一能走的路就是把規模推大,而推大這件事天然導致集中。這是商業邏輯,不是物理定律。
  • 他自己買了一張 RTX 5090,單卡算力超過當年做 Transformer 研究時整個團隊用的八卡機器。研究的硬體門檻其實一直在掉。
  • 人類就是「小資料也能變專家」的存在證明。我們不是通才,也沒有一顆全人類共用的大腦,但各領域專家在自己的領域打得贏超大模型。
  • OpenAI 從純研究實驗室變成必須出產品的大公司,研究專注度下降,這反而是學術界跟開源社群的窗口。
  • 他的樂觀有個前提:需要一個還沒出現的研究突破。這是這集最誠實也最不確定的部分。

這集是誰在講話

這集是 a16z 旗下 MTS(Monitoring the Situation,a16z 開在 X 上的媒體頻道,走的是即時、輕量的訪談路線)在 2026 年 9 月 7 日放出來的短集,主持人 Sophia Dew 跑去舊金山的 Open Source AI Summit 現場堵人。

受訪的 Łukasz Kaiser 是 2017 年那篇《Attention is All You Need》的共同作者之一,也就是把 Transformer 這個架構丟出來、直接改寫整個現代 AI 走向的那八個人裡的一個。他 2021 年從 Google 跳到 OpenAI,現在是資深研究科學家,也是 o1 系列推理模型(reasoning model,會先在心裡推導一遍再回答的那種模型)的核心貢獻者。換句話說,這個人既參與了「把規模推大」這條路的起點,也參與了「往推理找出路」這條路的現在。他來談集中化,講的不是外部批評,是內部視角。

「變大」是唯一不需要靈感的路

Kaiser 講了一段我覺得整集最值得抄下來的話。

他說研究突破這種事,有時候會來,有時候不會來。它不是一個商業提案,你沒辦法跟董事會說我們第三季會有一個 breakthrough。但大公司還是得往前走,那怎麼辦?答案是「你可以在沒有研究突破的情況下做事,就是變大、變更大、再變更大」。

這句話把整個集中化的機制講得很乾淨。不是有人坐在會議室裡決定「我們要壟斷 AI」,而是在所有可執行的選項裡,只有一條路的成功機率是可預測的。研究突破不能排進 roadmap,加十倍算力可以。於是所有有錢的玩家都選了同一條路,而這條路的入場費是幾十億美金加上把整個網際網路爬過一遍。

集中就是這樣長出來的。它是一個副作用,不是一個目標。

這個判斷方向跟前幾天 Box 執行長 Aaron Levie 在同一個 podcast 上講的邏輯其實接得上,之前寫過的Box 執行長 Aaron Levie:擋住中國的結果,是美國用貴的 AI裡有提到,錢真正的收銀機在推論那一端。Kaiser 補的是更上游的那一段:為什麼一開始會走到需要那麼多錢。

Transformer 有一個很少被講的弱點

Kaiser 對自己的作品評價很誠實。他說 Transformer 真的很強,前提是你把整個網際網路餵進去,這樣它就會變得「還算聰明」。

但如果你只跟它說「你就只學這個東西」,它就很笨。他的原話是 it doesn't work that well。

這一點我覺得一般人比較少聽到。大家對 AI 的印象是「資料越多越好」,但反過來想這句話的意思是:Transformer 沒有辦法從少量資料裡學到深的東西。它必須把全世界吞下去才能表現得像懂一點。這跟人的學習方式差很遠。一個學徒跟師傅做三年,看的案例可能不到一千個,但他在那個領域的判斷力可以贏過看過十億張圖的模型。

Kaiser 說這是個研究問題,不是宿命。而且他認為答案一定存在,理由很直接:我們自己就是證明。

人類是世界上最厲害的電腦,而我們不是通才,也沒有一顆屬於全人類的大腦。

他推得更遠一點:給定一份固定大小的資料,最好的學習方式,說不定本來就是「一堆各自很強、合起來更強的分散式模型」,而不是一個吃掉所有東西的巨無霸。他提到 ensemble(把多個模型的判斷合起來用)這類基礎研究其實已經有一些理由支持這個方向。

兩條路的差別大概長這樣:

目前的大模型路線他想像的分散路線
資料需求整個網際網路小得多,領域專屬
硬體門檻幾十億美金等級的資料中心學術實驗室、個人研究者可負擔
誰能參與少數幾家公司大學、開源社群、小團隊
現在的狀態能用,且在賺錢還沒找到方法

最後那一列是重點,也是我等一下要潑的冷水。

一張顯示卡的對比

這集最有畫面的細節是這個。

Kaiser 說他最近開始自己做一些東西,買了一張 RTX 5090。然後他發現,這一張卡的算力,比當年他們整個團隊拿來做 Transformer 研究的那台八卡機器還強。

九年,從一整個團隊共用一台機器,到一個人在家裡桌上就能超過它。

他很清楚這不代表你可以在家訓練一個大型 LLM,那還是要資料中心。但他說「你可以拿它做研究、做實驗」,而且他認為很多人都應該去做。

這個門檻下降的速度,跟當年架網站的邏輯很像。二〇〇〇年代初你要架一個能撐流量的網站得自己買伺服器、租機櫃,後來一台雲端機器月租幾十塊就搞定,於是一堆本來不可能存在的產品出現了。研究這一端現在正在發生類似的事,只是還沒有人把它變成一個明顯的入口。

開源社群拿到的那個窗口

Kaiser 講了一件在 a16z 的節目上講出來還滿直白的事。

他說他剛加入 OpenAI 的時候,那是一個非常研究導向的實驗室。現在呢,它「還是有點研究實驗室的樣子,但也是一家很大的公司,得做產品跟其他一堆事情」,所以研究的專注度變低了。

然後他接了一句:這給了開源運動機會,給了學術界跟大學機會。

我覺得這句話的重量比表面大。前沿實驗室被產品需求綁住之後,那些短期看不到商業回報、失敗率高、可能三年都出不了東西的基礎研究,就變成沒人做的空地。而這種空地歷史上通常是被大學跟業餘研究者填掉的。

這也跟 Factory 共同創辦人 Eno Reyes 在「最聰明的模型其實是最便宜的」裡提到的「智慧主權」是同一個問題的兩面:一邊是誰有能力做出智慧,一邊是誰有能力擁有智慧。

那個永遠關於原子的笑話

Kaiser 用了一個很生活化的例子收尾。

他說你現在去問任何一個大型語言模型講個笑話,講出來的永遠是同一個,大概都是關於原子的那一個。

這件小事其實是模型同質化最誠實的指標。所有模型都吃同一批網路資料,所有模型都用同一套架構,所以幽默感也長得一模一樣。他認為在分散式模型的世界裡,這會改變,會有一個模型用這種方式講笑話,另一個用那種方式,就像不同的人有不同的笑點。

聽起來很浪漫。但我要在這裡誠實一點。

我的判斷

Kaiser 整套論述的支撐點只有一個:需要一個還沒出現的研究突破。他自己在訪談裡也承認了兩次,說「我們技術上還沒找到」「不知道該往哪裡找,這就是研究這件事」。

所以這集的樂觀,本質上是一張還沒兌現的支票。它可能三年後兌現,也可能十年都不會。中間這段時間,資本會繼續往「變大」那條路上堆,因為那條路是可預測的。這是我覺得聽這集要留意的地方:他講的可能性我完全同意,但可能性跟時程是兩件事,而錢只在乎時程。

不過有個部分我覺得幾乎可以直接拿來用,就是那張顯示卡。門檻已經降到一個人在家就能做真正的實驗,這件事不需要等任何突破,它現在就是真的。如果你本來覺得「這場遊戲跟我沒關係,反正都是大公司在玩」,這個判斷至少在研究這一端是過時的。

Kaiser 最後那句話我滿喜歡的:集中發生了,是因為那是當時最方便的做法,而且它證明了很棒的事情可以被做出來,這是好事。但那只是這一年、下一年的事,是技術路上的一步,不是終點。

自行斟酌,共勉之。

想看更多這類產業第一線的觀察筆記,都會發在 wilsonhuang.xyz,訂閱就不會漏掉。

Sources:

推薦閱讀

喜歡這篇文章嗎?

訂閱電子報,每週收到精選技術文章與產業洞察,直送你的信箱。

💌 隨時可以取消訂閱,不會收到垃圾郵件