
他們在訓練一個「跟我一樣笨」的模型,估值二十億美金
TL;DR
- Simile 創辦人 Joon Sung Park 就是 2023 年那篇 Generative Agents(小鎮模擬)論文的第一作者,Google Scholar 引用數已經超過七萬兩千。
- 他的核心賭注:在做出真正好用的個人助理之前,你得先有一個夠準的「人的模型」。順序不能倒過來。
- 前沿模型被訓練成超理性的答題機器,但預測真人行為時準確率會掉到兩三成。Simile 反過來做,要模型犯跟人一樣的錯。
- 他們用一千個真人做過一次硬驗證:兩小時訪談造出數位分身,兩週後讓真人回來重做一輪測驗,分身的預測準確度達到人類自己重測的百分之八十五。
- 資料分三層:訪談、觀察到的行為、隨機對照試驗。第三層最貴也最關鍵,因為它記錄的是「為什麼」。
- 模擬跟預測是兩件事。決策者要的從來不是知道未來會怎樣,而是知道現在該做什麼才不會走到那個未來。
- Simile 今年七月完成兩億美金 B 輪,估值二十億美金,客戶包含 CVS Health、Wealthfront、Deloitte、Gallup。
這集在講什麼
這集是 Latent Space 在二〇二六年八月二十一日放出來的。Latent Space 是 swyx 跟 Alessio Fanelli 主持的 AI 工程訪談節目,找的來賓大多是正在第一線把模型變成產品的人,技術含量高但不學術,算是這圈子裡少數會把架構細節聊到底的節目。
這集來賓是 Joon Sung Park,Simile 的共同創辦人兼執行長。他在史丹佛念博士的時候寫了 Generative Agents,就是那篇讓一堆 AI 角色住進一個叫 Smallville 的虛擬小鎮、自己安排行程、自己辦派對、自己談戀愛的論文。那篇的記憶架構到現在還被大量抄。Simile 是他跟三位共同創辦人開的公司,另外三位分別是史丹佛 HCI 教授 Michael Bernstein(ImageNet 論文的共同作者之一)、提出 foundation model 這個詞的 Percy Liang,以及負責商業面的 Lainie Yallen。公司做的事情一句話講完:用 AI 模擬真人的決策行為,賣給需要做決定的大企業。今年二月才用一億美金 A 輪從隱身狀態出來,七月就以二十億美金估值再拿兩億,五個月翻一倍。
十年後回頭看,什麼才重要
Park 這段職涯開頭其實跟 tech 沒關係。他在韓國住到十一歲,全家搬到波士頓,父母都是醫生。他自己原本要當畫家,油畫,畫人物,走的還是寫實派的路子。轉進電腦是因為想通了一件事:最厲害的藝術家常常是自己創造媒材的人,而那個時代最好的媒材是運算。
二〇二〇年他進史丹佛,剛好卡在 GPT-3 要出來的那個時間點。當時實驗室裡的共識是懷疑:這種沒有被訓練來做任何特定任務的模型,到底能幹嘛?
他們玩了一個遊戲,內部叫「時光機遊戲」。假設現在坐上時光機跳到十年後回頭看,這項技術最重要的那個應用會是什麼?
第二名的答案是超級個人化的 AI 助理。這個大家都想得到,而且現在也真的在發生。
第一名的答案是:重建我們生活的這個世界。
我很喜歡他解釋為什麼選了第一名。他說如果你要做一個好用的個人助理,你叫它幫你買晚餐,它訂了一個夏威夷披薩,而你討厭鳳梨上披薩,那它就徹底失敗了。要讓它不犯這個錯,唯一的辦法是它對你有夠深的理解。這就是我們跟家人、跟最好的朋友之間的東西:他們腦中有一個關於你的模型。
所以他的判斷是,「準確地模擬人」這件事,在時間順序上必須走在「自動化世界的複雜 agent」前面。這個順序如果搞反,你會做出一堆很聰明但一直踩雷的助理。
順帶一提,他對現在的個人助理評價很直接:還沒有任何一個真正達到那個野心。ChatGPT、Claude 確實知道你不少事,回應也比以前貼身,但目前主流做法就是把你的資訊塞進一個 markdown 檔案。他說這招其實很聰明,因為當年做 Generative Agents 的記憶系統時他們也試過知識圖譜、也想過訓練專用模型,最後結論是語言模型本來就很會處理文字,那就全部丟進文字檔就好。但這招有天花板:當資料量大到一個程度,怎麼檢索、怎麼理解,就變成很吃力的工程。有些東西你不動模型參數是塑造不出來的。
那個判斷「該不該訓練」的分界線
主持人問了一個好問題:什麼時候該 prompt 就好,什麼時候非得訓練不可?
Park 的分界線很乾淨:如果模型必須學會它所處世界的底層物理,那就得訓練。如果它已經有了那個物理、你只是要它對環境做出反應,那 prompt 就夠了。
他認為現在市面上的模型,還沒學會人類社會的完整「社會物理學」。原因藏在訓練資料裡:這些模型讀的是網路上的東西,而網路上的東西本質上是人「自己說自己是什麼樣的人」,行為資料只是零星散落其中。人在網路上說他會做什麼,跟他在現實中真的做什麼,中間差很多。這一塊他稱為「人類的暗知識」。
這就是 Simile 想做的 behavior foundation model 要補的洞。
三層資料,第三層最貴
他們把資料分成三桶。
第一桶是訪談。字面上就是「請你講一下你的人生故事」,跟主持人開場問他的那句話一模一樣。他說這種長尾資訊給你的紋理很難取代,一個人的童年記憶、創傷、初戀,這些東西對於預測他的行為出乎意料地有用。
第二桶是可觀察的行為資料。交易紀錄、可以從網路上抓到的東西。這一桶給你的是行為的基礎統計。
第三桶是他認為最重要的:因果機制,也就是「為什麼」。要拿到這個,最好的辦法是 RCT(randomized controlled trial,隨機對照試驗)。同樣的設定,只動一個變數,看行為怎麼變。喝咖啡那天跟沒喝咖啡那天,你的決策有沒有不一樣。
為什麼因果機制這麼重要?因為找上他們的客戶,要的根本不是預測未來。除非你在跟股市對賭,否則對一個決策者來說,聽到「你的銷售兩季後會崩」一點幫助都沒有,他只會說「那真慘」。他真正想知道的是:現在該做什麼才能避開那個未來。
而這種資料極難取得,因為現實世界只跑一次。同一個情境不會有平行對照組。
Simile 的做法是自己跑大量的 RCT。他們把人請到實驗室或線上實驗室,設計會逼出真實行為決策的情境。關鍵在於「賭注要是真的」:例如做一個線上商店的實驗,受試者買了什麼就真的把東西寄給他。這是從社會科學那邊借來的手法,也是「態度」跟「行為」的分界線。他特別強調整個流程有完整的知情同意,受試者知道自己的資料會被用來建立分身。
心理史學那一段
如果你看過 Asimov 的《基地》系列,Park 舉的例子會很有畫面。
第一部的第一幕,一群科學家算出銀河帝國即將崩潰、接下來會有三萬年的動盪,他們跑心理史學模擬,想把動盪壓到一千年。而模擬吐出來的第一步建議是:把這群發出警告的科學家流放到銀河邊陲一個叫 Terminus 的鬼地方。
完全反直覺。但那就是對的第一步。
他用這個講模擬跟預測的差別。模擬在最理想的狀態下,不是回答「大家對這份問卷會怎麼填」,而是你給它一個目標,它把從現在走到那個目標所需要的每一步攤給你看。而那些步驟可能長得很奇怪。
換成現實一點的例子:一家車廠要推電動車,想知道怎麼行銷才能拉股價。模擬可能告訴你,你用 XYZ 這套方式行銷電動車是有效的,但它會改變消費者對你非電動車產品線的觀感,整體銷售反而會掉。如果你只盯著電動車銷量這一個指標,你會得出一個看起來很合理、實際上很糟的答案。
那個百分之八十五
聊到這裡主持人問了最該問的問題:你怎麼知道這不是在幻覺上面疊幻覺?
Park 拿出了 Generative Agents 之後的那篇論文,叫 Generative Agent Simulations of 1,000 People。做法是這樣:找一千個具有美國人口代表性的真人進線上實驗室,花兩小時做深度訪談加上各種行為資料收集;把人送走兩週,這段時間用資料建出他們的數位分身;兩週後把真人請回來,做一整套測驗,包含行為經濟學遊戲、五大人格測驗、General Social Survey、還有已經發表在 PNAS 上的隨機對照試驗。
然後讓分身去預測本尊會怎麼答。
結果是百分之八十五。這裡的分母不是「答對率」,而是「同一個人自己隔兩週重測的一致性」。人類自己重測都不會百分之百一致,分身達到人類自我一致性的百分之八十五。
對照組更有意思。前沿模型在這件事上表現並不好:一般人口的題目大概五到六成,一旦進到客戶真正在乎的小眾族群,會掉到兩三成。這個準確度你根本不敢拿來做決策。
原因他講得很妙:這些前沿模型正在被訓練成超理性的客觀機器,資料來自專業程式設計師、科學家,目標是推理能力極大化。而 Simile 要的模型「要跟我一樣笨」。我犯什麼錯,模型就要犯什麼錯。
這件事比想像中難。主持人當場點破這是在解莫拉維克悖論的變形。這也跟我之前寫過的兩件事扣在一起:找不到那張沙發,是因為 AI 太想猜「大家都會選什麼」裡講的,模型的訓練目標本來就是往平均值收斂,而真實的人恰恰活在分布的邊緣。
為什麼組合爆炸法不夠
有人會問:那我直接窮舉不就好了?把全世界的職業、背景、人格特質做成一個大矩陣,生成十億個 persona,這不就有一個社會了嗎?騰訊真的有一篇論文這樣做。
Park 對這篇的評價很禮貌但也很清楚。規模值得敬佩,你最終確實需要模擬大型社會。但這個做法完全依賴模型參數裡已經有的統計知識。如果你相信那些統計是對的,那這招沒問題,只是你在做的事情本質上是「把模型裡已經有的知識檢索出來」。
問題是那些統計就是不對,尤其在小眾族群跟細節上。而人的細節,單獨看每一條都很無聊,拼起來卻異常豐富。
他還講了一個我很喜歡的例子。他在史丹佛念書時住在 Palo Alto,走路回家要四十分鐘。你問模型「我要回家」,它八成幫你叫 Uber 或給你公車時刻。但他就是喜歡走那四十分鐘,因為那段時間他可以想事情、可以在腦子裡亂逛。這件事不效率、可能也不「正確」,但那就是他。
模型如果沒看過這種東西,就永遠抓不到。
從紅點藍點到高解析度的社會
Park 提到一個對他影響很深的人:Thomas Schelling,就是 Schelling point 那個 Schelling。
一九七〇、八〇年代,Schelling 做了最早的 agent-based modeling(代理人基模型,用簡單規則驅動的個體來模擬群體)。他做了一個格子世界,裡面只有紅點跟藍點,規則很簡單:如果你周圍鄰居裡異色的比例超過某個門檻,你就隨機搬家。
結果很反直覺。當時大家認為社會的種族隔離是明目張膽的種族主義造成的。但這個模型顯示,就算每個個體只有極其輕微的同色偏好,整個社會最後還是會完全隔離。這項工作後來直接影響了混合收入住宅政策,Schelling 也因為奠定了模擬研究的基礎拿到諾貝爾經濟學獎。
主持人補了一句很有意思的註腳:新加坡有八成人口住在組屋,而組屋有強制的種族配額,理由正是這個。
Park 的判斷是,agent-based modeling 從二〇〇〇年代之後就慢慢被學界淡忘了,因為紅點藍點對人的描述實在太貧乏。但生成式 AI 出現之後,我們第一次有機會做出解析度夠高的版本。他認為這條線上還有一座諾貝爾獎在等人。
成本、規模,跟一個很誠實的類比
我一開始也在擔心成本。模擬幾億人要花多少錢?
實際上他們現在的規模是每週收集數萬人的資料,透過 panel 合作夥伴可以觸及全球數千萬人的樣本池。已經部署在全球最大的一批企業裡。他說在多數核心使用情境下,數萬到數十萬人就綽綽有餘,因為客戶要的不是統計顯著性,而是「能不能篩到我要的那個子族群」。
有一個很關鍵的效率點:一個人一旦被建成模型,之後所有研究都可以重複使用。因為這些 agent 是 domain agnostic 的,你在學的是這個人的社會物理,而不是他對某個產品的看法。有些特質會變(你這週去了幾次藥妝店),但有些幾乎不變(你的風險偏好)。
至於未來,他的猜測是接下來幾年會出現「跑一次模擬的成本相當於訓練一個基礎模型」的情況。他說得很直白:現在一堆公司花幾千萬美金訓練基礎模型,只是為了說自己訓練過一個。如果有一個社會層級的模擬可以真的解掉氣候變遷,我今天就跑,我現在就去募這筆錢。
主持人也補了另一個角度:現實中跑一場真研究本來就超貴,而且常常根本不可行。Sam Altman 在非洲資助的那個 UBI 研究花了一千四百萬美金、跑了五年,最後產出一個結論。如果模擬可以瞬間跑一千次,那個價值差距不用算。
商業上他們現在的主力使用情境是 concept testing(概念測試,行銷上測不同訊息、包裝、產品概念的反應)、焦點團體,甚至有客戶拿來模擬法說會。Wealthfront 是第一批要求做「超越問卷」的客戶,他們的 agent 現在可以吃多模態輸入,看圖、逛 Figma 稿、甚至給一個網址讓它去用一陣子。這件事讓我想到 讓 Claude 去開店、跑咖啡廳、養機器人:Andon Labs 用「真實世界」當 AI 最後一道考題,方向相反但精神一樣:都在逼 AI 離開考卷、走進真實情境。
政治這塊他們刻意還沒碰。跟 Gallup 有策略合作,Gallup 本身很深入政策圈,但 Park 說政治是一個公司必須格外謹慎的領域,他們想先把護欄跟觀點想清楚再進去。這個自制我給予肯定,雖然我也不確定能撐多久,畢竟需求擺在那裡。
我的幾個判斷
第一,這門生意最迷人的地方在於它把一個「調研成本」問題偷偷換成了「決策品質」問題。市場調研是一千億美金的產業,但 Park 說模擬不是市場調研工具,是人類決策工具。TAM 到底多大他自己也算不出來。這種答不出 TAM 的公司通常有兩種結局,而他們現在看起來走在比較好的那一邊。
第二,最值得記住的是那個順序判斷:模擬要先於自動化。現在整個產業都在猛衝 agent,很少人回頭想「這個 agent 到底懂不懂它服務的人」。如果 Park 是對的,那今天很多 agent 產品的天花板不在模型能力,而在對使用者的理解深度。
第三,我對「用模擬取代真人研究」這件事還是留一點警覺。百分之八十五聽起來很高,但剩下的百分之十五在哪裡、會不會系統性地偏向某些族群,這是要持續盯的。Park 自己也說了,這技術現在大概相當於 AGI 敘事裡 GPT-3.5 到 GPT-4 那個階段:已經能在特定垂直領域造成真實影響,但後面還有很多還沒發生的突破。
最後那個問題主持人當然沒放過:我們現在是不是活在模擬裡?
Park 的回答我蠻喜歡的。他說是不是模擬他不太在意,因為那不會讓我們的經驗變得比較不真實。也許是,也許不是,但對我們來說它是真的。
如果這類把技術跟人性交叉著看的東西合你胃口,我會持續寫,訂閱 wilsonhuang.xyz 就不會漏掉。
Sources:
推薦閱讀
喜歡這篇文章嗎?
訂閱電子報,每週收到精選技術文章與產業洞察,直送你的信箱。
💌 隨時可以取消訂閱,不會收到垃圾郵件


