醫療 AI 考了九十二分,實際做事只拿四十五分

醫療 AI 考了九十二分,實際做事只拿四十五分

發布於
·24 分鐘閱讀
AIAI Agent醫療產業觀察創業VC投資監管資料商業

TL;DR

  • 醫療 AI 在執照考試上可以拿到九成二的分數,但在真實臨床任務上掉到四成五。考試會考的跟醫院真的要它做的事,中間隔著一條沒人量過的溝。
  • 現在誰在幫這些 AI 打分數?答案是「所有人,同時也沒有人」。每一家廠商都印一份自己最強的簡介,結果就是沒有人知道誰最強。
  • 最難抓的不是災難性的錯誤,而是細微的偏誤。前者好定義(有沒有死人),後者連定義都很困難。
  • 醫療的資訊不對稱本來就存在,把 AI agent 疊上去之後,病人在中間完全沒有話語權。
  • 測驗資料被污染是真實問題。為了做一份乾淨的評測,他們得打電話問醫院「你們病理科抽屜裡有哪些切片是從來沒被掃描過的」。
  • 政府不會做這件事。與其等,不如先做出來讓人挑戰。

這集在講什麼

這集在 2026 年 8 月 24 日播出的 a16z Podcast,來自 a16z 的 Bio + Health 團隊。主持人是 Daisy Wolf 跟 Eva Steinman,兩位都是 a16z 專門看醫療科技投資的合夥人,這個團隊過去投過 Function Health、Truemed 這類健康新創,也投了今天的來賓所屬的公司。

來賓 Engy Ziedan 是 Protege 的共同創辦人兼首席科學長。她本身是健康經濟學家,原本在 Tulane 大學當經濟系助理教授,2026 年起轉到 Indiana University 的 O'Neill 公共與環境事務學院,研究主題就是用準實驗與因果推論的方法來評估 AI。她的研究上過紐約時報,也被 CDC 引用過。

Protege 這家公司,一句話講就是「AI 的真實世界資料層」。2024 年由 Bobby Samuels 跟 Travis May 創辦,兩人之前都在 Datavant 跟 LiveRamp 這類資料公司待過。Protege 做的事情是把手上握有私有資料的機構(醫院、媒體、內容方)跟做 AI 模型的公司合法地接在一起,目前累積了三十億份以上的臨床紀錄、一億張醫療影像,累計募了六千五百萬美金。Engy 在裡面帶一個叫 Data Lab 的單位。

先講清楚我為什麼覺得這集值得寫:這不是又一集「AI 好厲害」或「AI 好可怕」的節目。它問的是一個很少人問的中間問題——我們憑什麼相信它?

Uber 沒人要求看評測,為什麼 AI 要

Engy 是經濟學家,她的切入角度很特別。

經濟學家怎麼推算一個東西的價值?用一個叫 hedonics(享樂定價法)的做法,看人們願意付多少錢。最典型的例子是學區決定房價,你不用問學校好不好,看房價就知道了。

她說,當年沒有人問過「Uber 的價值是多少,把評測拿出來給我看」。大家就是付錢上車,久了「Uber」還變成一個動詞。

但 AI 不一樣。因為這個技術的邊際成本不是零。你付的不只是訂閱費,你付的是 token、是導入的時間、是「這東西出錯的機率」。這些成本是真實存在的,所以定價需要準確,市場才會出清。

她講了一句我覺得很到位的話:你要雇一個員工,你會確認他能不能勝任這份工作。你要雇 AI,你也得確認它能不能勝任。

這個類比在醫療領域被放大到很誇張的程度。美國現在大概有一百萬名醫師,這些人受過將近十年的專科訓練,考過的題目遠遠不只五千題。現在等於是說,我們要再雇一百萬個醫師,這批新來的考過了一份五千題的可愛考卷,然後就放他們進去自由發揮,看看會怎樣。

聽起來很荒謬,但這差不多就是現在正在發生的事。

最難抓的不是出人命,是那些看起來很合理的偏差

大家談 AI 安全,第一時間想到的都是災難性失敗。Engy 說,那個其實是簡單的問題。因為災難性失敗很窄,你可以直接定義成「死亡率」,量得出來。

真正難的是 misalignment(目標錯位)跟細微的偏誤。難在它很難定義,更難偵測。

她舉了保險理賠的例子。現在有一堆公司在做保險端的 AI,醫院這邊也在導入 AI 處理事前授權跟理賠申訴。用經濟學的講法,這是一個 Edgeworth box(雙方交換的分析框架),兩條無異曲線在契約線上碰頭:一邊要最大化營收、最小化理賠支出,另一邊要最大化能追回的金額。兩邊都拿著 agentic 工具在打,病人夾在中間,完全沒有話語權,而且沒有任何監理機關會跳出來說「這個模型表現超好,但它其實站錯邊了」。

她問她的團隊三個問題,我覺得每一個都值得停下來想:

如果你要被開一個處方,模型先去查你有沒有欠醫院錢,這樣公不公平?

如果醫院設定「不要把病人轉診到網外」,模型照做,這樣公不公平?可是你的偏好可能就是「有時候我願意花錢看網外的醫生」。

如果一個護理師跟同事聊天時對某個病人講了幾句負面的話,模型因此變得「過度積極」,推薦讓這個人提早出院——因為這樣護理師可以早點下班——這樣公不公平?

這些全部都不會出現在任何一份災難性失敗的統計表裡。但它們每天都在發生。

那份病歷上寫著「她看起來很邋遢,她先生問的問題還不錯」

這是整集最讓我不舒服、但也最有啟發的一段。

Protege 手上有幾千億份醫療紀錄。Engy 說她讀這些紀錄的時候會看到這種句子:「她看起來很邋遢,她先生問的問題還不錯。」

這句話的實際意思是:這個病人講的話不可信。然後你往下看,診斷突然變成「她說的那個痛可能是心理問題」,臨床上就不再深入追查了。

有趣的地方來了。AI 錄音轉寫工具(像 Ambience 這類產品)做的事情,是把醫病對話直接記錄下來、生成一份 SOAP note(標準病歷格式)。那些主觀的評語就這樣被切掉了。剩下的是一份對這場對話的準確描述。

第三方醫師看到這份紀錄,很可能的反應是:這個痛應該安排臨床檢查查一下原因,我不覺得只是心理作用。

換句話說,AI 在這裡不是製造偏見,是消除了一個人類偏見。Engy 說,這種好處現在根本沒有人在評估。

我們花很多力氣擔心 AI 會不會複製訓練資料裡的偏見,但同一枚硬幣的另一面是:人類本來就充滿偏見,而且人類的偏見不會留下可稽核的紀錄。這一點在之前寫企業 AI 導入的正確姿勢那篇裡也提過類似的張力,Cleveland Clinic 的敗血症模型能把死亡率降四成一,但最後一成的案例機器就是抓不到。好處跟壞處往往綁在同一個機制上。

Nature 說通用模型贏,arXiv 說也是,然後呢

主持人提到最近有一篇 Nature 的論文說通用 AI 在醫療上打贏了專科 AI,緊接著 arXiv 上又出現一篇得到完全相同結論的論文。

Engy 的回應很誠實:這些評測非常敏感。敏感到什麼程度?

敏感於你怎麼寫提示詞。敏感於你用什麼 harness(外層執行框架)。在腫瘤病理這種任務上尤其明顯。最誇張的是,光是把選擇題的選項順序調換,模型的排名就會翻盤。

有些人認為這代表 benchmark 被污染了——模型只是背下了正確答案在第幾個位置,跟一個死背考古題的學生一模一樣。

然後你要花幾百萬美金導入這些工具。你當然想知道哪一個最好、哪一個在哪件事上最好。

Engy 說這還只是「簡單模式」。往前看,模型會遇到資料漂移,每個醫師可能都有自己的模型(把個人的上下文變成權重),還有 test-time training 這種模型持續進化的做法。你在 2024 年的技術上做評測、2026 年才發表論文,這種東西根本沒有意義。

她提到一個對照組:美國政府從 2007 年開始做 Value Based Purchasing(價值導向採購),八成的給付跟品質掛鉤。指標長什麼樣子?比如「你這個醫生開了幾次抗生素給看起來像病毒感染的病人」,或是「你這間護理之家有幾個老人跌倒骨折」。這些報告通常是回溯性的,六個月甚至一年後才出來。

AI 不能這樣做。它變太快,而且它有 agency(自主行動能力)。

應該要有一個一直在旁邊看著的人

主持人問,那持續監控跟季度/年度報告之間,怎麼拿捏平衡?

Engy 的回答挺有意思。她說如果我們有勇氣、而且不害怕——因為醫療業充滿行政工作,你只要一提「新科技」,大家就往後退一步說「你不懂這個產業,這是佔 GDP 兩成、一億五千萬個工作裡佔兩千萬個的產業,祝你好運」——但如果把這些都拋開,只問「正確的做法是什麼」,答案是:應該要有一個隨時在看的守望者。

當我作為醫師,我的本地 AI agent 開始把我推向那些利潤最大化但傷害病人的決策時,我要被提醒。

當模型因為一段對話而變得過度積極、推薦了不安全的方案時,要有一個東西跳出來說:這個行為不可接受。你不能因為想早點下班就讓這個人提早出院,我不認為這是一個中立的判斷。

醫生自己也有「路數」,那到底誰錯

這一段我覺得是整集最精彩的洞察。

benchmark 為什麼會失效?Engy 說除了題目不夠貼近高風險場景之外,還有一件常被掃到地毯下的事:醫師跟所有職業一樣,有自己的偏好。

投資人有偏好,有人愛冒險有人不愛。醫師也有自己的路數。

她拿膝關節置換手術當例子。有些醫師從來不做全膝置換,只做部分置換。有些醫師只要碰到膝蓋就是全膝置換,從不做部分。這就是他的路數。

現在你把一份真實病歷丟給模型,問它建議怎麼做。模型給了一個跟主刀醫師相反的答案。你說:模型錯了。

但也可能是醫師錯了。他有一個黏著的偏好,經濟學叫 hysteresis(遲滯效應)。

這就是評測的天花板。而且真正的問題在後面:當模型變得比平均水準的醫師還好的時候,怎麼辦?答案不可能是「那就多問幾個醫師,用大數法則來救場」。到了某個程度,任務會專業到、風險高到,你必須在真實的照護現場當下測試。

而你要拿的分數不是「它會不會考試」,是「它做過這件事嗎,做得好嗎」。

你要開脊椎手術,他們跟你說這個模型考過了一萬題問答。你會信它,還是信一個做過四千台這種手術的醫師?

抽屜裡那些從沒被掃描過的切片

Protege 現在被客戶拉去做一件很有趣的事:當裁判。

他們把類似的垂直 AI 公司分成一個個 subnode(子節點),比如錄音轉寫、臨床試驗媒合、護理流程、排班、腫瘤病理。同一個 subnode 裡的廠商互相是「夜裡的船」,我不知道你比我強還是弱,你說你最強,我也說我最強。

於是這些公司跑來說:可以請你託管我的模型,讓它接受一個統一的評測,然後生一份報告,把我們互相比一比嗎?我們也想知道自己在哪裡比較弱。

這個角色很微妙,因為裁判要做一堆判斷:提示詞應該怎麼寫?前沿模型要不要幫它客製一個 harness,還是用內建的就好(有些世界模型根本不需要 harness)?模型拒答的時候怎麼算,給平均值還是換次佳模型?這些選擇會不會改變最終排名?

Protege 的做法是方法論對整個 subnode 完全公開,參與者名單到最後才揭曉,中途可以安靜退出。

至於資料污染怎麼解,這一段我笑出來了。Engy 說她一開始覺得這根本不是問題:我們有兩億人的資料、幾千億份紀錄,我只要找一批從來沒給任何人訓練過的資料就好了吧。

團隊跟她說:我們手上八成的資料都給出去訓練過了。如果你的「獨立」定義是「模型從來沒見過這個病人」,那你面前有個大挑戰。

所以做腫瘤病理評測的時候,他們真的得去打電話問醫院:「你們病理科抽屜裡,有哪些切片是從來沒被掃描過的?」

全新的切片。這個病人從來沒有進過任何模型。

現在 Protege 內部有一條規則,她稱為「封膜」:任何進過訓練的資料集或病人,都不准出現在 benchmark 或評測裡。

有些研究者會跟她辯:這個模型在這個任務上表現得比隨機還差耶,有一點點污染又怎樣,反正不影響判斷。她的回答是:比隨機還差本身就可能是嚴重錯位的訊號啊,你不覺得應該搞清楚為什麼嗎?

為什麼是 Protege,而不是政府

主持人問了一個尖銳的問題:模型公司從你這裡買資料,那你憑什麼當評測的裁判?

Engy 用比較利益的框架回答。絕對優勢是「我們在這件事上最強」,比較利益是「在我們做的所有事情裡面,做醫療訓練資料跟評測的邊際成本最低」。

但她說有優勢不代表有贏的權利。真正的權利來自一個自然演化出來的閉環:做完評測之後,測試集永遠留在他們手上不外流;一旦你的某項能力被驗出有缺陷,他們可以直接告訴你,補什麼資料能改善這項缺陷。發現問題、然後立刻補上教材。

至於保持中立的動機,她的說法很直接:任何網路效應的東西,一旦失去信任就會瞬間爆炸性瓦解。所以你被自己的處境牢牢綁住。

那為什麼不等政府做?

「因為政府不會做。」她說,比較不安全的做法是坐在那邊等政府動手。比較安全的做法是先做,然後讓人來挑戰你。

她補了一句挺刺的:政府連讓人線上報稅都搞不定,最後還是要民間發明一個線上平台幫他們收。現在聯邦有一份公開徵求文件,內容就是請業界幫忙想想「AI 該怎麼評估」。

她自己的博士論文寫的就是一個懲罰醫院再入院率過高的政策,光是「這個政策有沒有造成更多再入院」這一個問題,就花了整個學界十年、幾千篇論文才評估完。而在 AI 評測上,你可以對一個 agentic 系統在醫院裡的行為問一千個問題。

我的幾個判斷

第一,這集其實是在講一個比醫療更普遍的問題:AI 產業目前沒有一個可信的第三方計分機制。所有的排行榜要嘛是廠商自己發的,要嘛取樣有偏差。之前在Arena 執行長談開源模型與排行榜偏差那篇裡也碰過同一個問題,只是那邊講的是通用模型,這邊講的是人命。

第二,「考試分數」跟「工作表現」的落差,不是醫療獨有的。九成二對四成五這個數字之所以震撼,是因為醫療的後果最嚴重、也最容易被量化。但你的公司導入 AI 的時候,面對的是同一個結構問題:你憑什麼相信 demo 裡的表現能複製到你的流程上?

第三,那個「有一個守望者一直在旁邊看」的想法,聽起來像成本,其實可能是必要的基礎建設。人類醫師要跨州執業得重考執照,而 AI 工具進到醫院唯一的憑證是廠商自己說「我們拿它跟幾個醫生比過,它贏了」。這中間的落差大到很難合理化。

第四,最讓我在意的是那個「模型過度積極」的例子。它不是模型壞掉,是模型很努力地在滿足一個它以為的目標。這比模型出錯難處理太多了,因為它每一步看起來都很合理。

Engy 最後那段話值得抄下來:人在乎自己的教育、在乎自己的錢、在乎自己的健康,這些是人力資本的核心公理。任何在這幾件事上的錯位,都會造成對 AI 的普遍不信任。

而我們不想走到那一步。她拿鴉片類藥物疫情當對照:2010 年到達高峰的時候,大家才開始說要成立國家級專案小組、才開始行動。

那時候已經太晚了。

自行斟酌,共勉之。

這類產業觀察我會持續寫,訂閱 wilsonhuang.xyz 就不會漏掉。

推薦閱讀

喜歡這篇文章嗎?

訂閱電子報,每週收到精選技術文章與產業洞察,直送你的信箱。

💌 隨時可以取消訂閱,不會收到垃圾郵件