模型會在你不知情時被換掉:Fable 5 生物防護放寬 85%
同一個帳號、同樣的問法,答案品質忽然掉一階。Anthropic 這次調整生物學防護,順手把「模型靜默降級」這個機制講清楚了。
用 AI 用久的人大概都有過這種時刻:同一個帳號、同樣的問法,昨天答得漂亮,今天突然變得含糊又保守。多數時候我們會怪尖峰時段、怪自己 prompt 寫壞了,換個講法再試一次就算了。
8 月 7 日 Anthropic 發了一篇公告,替其中一種情況給出了具體答案——你的請求可能根本沒有送到你以為的那顆模型。這篇公告表面上在講生物學防護鬆開了多少,底下藏著的是一個所有人都會遇到、卻幾乎沒被講清楚過的機制:模型的靜默降級。
先講數字。Anthropic 重新調校了 Fable 5 的生物學安全分類器,讓生物相關的 fallback 在各產品線平均下降約 85%。過去會被擋下來的那些日常問題——判讀檢驗報告的數值、搞懂某個症狀代表什麼、單純想弄清楚一段生物學知識——現在大多會放行。醫療專業人員在臨床任務上,也能拿到比以前更多的協助。
比 85% 更值得看的,是公告腳註裡那四個數字。把所有觸發原因加總,總 fallback 的降幅分別是:Claude.ai 約 67%、Cowork 約 55%、Claude Code 約 17%、Claude Platform 約 7%。同一次更新,落到四個介面上差了將近十倍。
這組數字其實是在替你回答「這件事關不關我的事」。你平常主要待在哪個介面工作,就對照哪個數字。習慣在 Claude.ai 裡查資料、整理訪談逐字稿、寫產品說明的設計工作者,會是體感最明顯的一群;而在 Claude Code 裡切版寫前端的人,可能整年都不會注意到有什麼不同。
Anthropic 用的防護方式是安全分類器(safety classifier):一顆比主模型小很多的自動化系統,站在前面判斷這個請求有沒有落在受保護的生物任務範圍。一旦它觸發,Fable 5 不會拒絕你——請求會被重新導向到 Opus 5,一顆同樣好用、但生物能力沒那麼強的模型。使用者看到的「fallback」,講的就是這件事。
關鍵在後半段:這個轉手是靜默的。介面不會告訴你「這則請求已改由另一顆模型處理」,你唯一能感覺到的訊號,是答案的質地變了。從安全設計的角度,沉默是合理的——如果系統明確指出是哪一句話觸發了分類器,等於免費送出一份繞過指南。但站在使用者這邊,這是一種幾乎無法 debug 的體驗:你不知道該修的是問法、是主題,還是這件事本來就不該在這裡問。
做產品的人遲早會撞上同一個題目。系統在背後做了保護性的降級,要不要讓使用者知道?講清楚等於教人繞過,完全不講,使用者只會覺得你的東西不穩。Anthropic 選了沉默那一邊,然後把力氣全部押在減少誤判上——重寫分類器,而非在介面上多加一行提示。這個取捨值得記下來:當你沒辦法解釋一個限制的時候,剩下的路就是讓那個限制少發生。
公告裡最誠實的一段,是他們承認 Fable 5 上線時「幾乎封鎖了所有生物查詢」,而且是刻意的。他們知道這會製造大量 false positive、會讓正當的生物學使用者非常挫折,還是選了這個 tradeoff——因為 dual-use 領域一旦被濫用,代價可能是災難性的。另一條路是壓著模型不出、等防護做完再說,那會讓所有人晚幾週到幾個月才用得到。
過去幾週他們做的事,是把分類器的 constitution 重寫一遍。那是一組規則,用來幫這顆小模型分辨什麼算受保護、什麼算放行,這次重寫特別把良性用途一項一項切出來;接著找內部與外部的專家給意見,依照新規則產生訓練資料、重新訓練,再驗證它對有害與 dual-use 內容仍然會觸發。官方那張圖把這件事畫得很清楚。

這是一個很具體的「先上線再收斂」版本。多數人談 MVP,談的是功能砍到剩幾個;這裡砍的是規則的鬆緊度。預設值先壓在保守那一端,讓東西能出門,再拿真實流量把邊界一格一格往回推。設計系統的元件約束、權限預設、內容審核規則,都能照這個順序走——前提是你真的會回來調,別把過度保守當成永久設定。
先講擋住的部分。dual-use 的三大類——virology、toxicology、molecular design——現在仍然全數 fallback,所以 Fable 5 到今天依然不適合拿來做專業生物研究和新藥開發。Anthropic 說這個缺口會用 trusted access pathway 來補,但那是還沒到貨的東西。分類器的 false positive 也不會歸零,safety margin 裡那些風險極低、卻還是會被擋下來的請求,官方直說「必然仍會存在」。
對設計工作者來說,真正要留意的是另外兩件事。第一,如果你手上有醫療、健康、生技類的案子——醫學插畫、症狀說明的介面文案、衛教內容——你會落在邊界的哪一側,很大程度取決於你怎麼描述用途。同樣一張圖,說「畫一張衛教手冊用的呼吸道解剖示意」和說「描述病毒進入細胞的分子步驟」,在分類器眼裡是兩個世界。把交付物和使用情境講在前面,等於直接把判斷依據遞過去。
第二,這篇公告從頭到尾沒有提到任何使用者端的可見性。沒有說會在介面上標記,也沒有提到 API 會回傳這次是否經過降級。把 Claude 接進正式工作流的人,目前只能靠答案品質反推,這個觀測缺口這次更新沒有處理。
把生物學那層拿掉之後,這篇公告在講的是一件更普通的事:當一個系統為了安全必須降級,它同時也放棄了一部分可解釋性。Anthropic 這次選擇用調準分類器把體驗換回來,而非用告知。85% 是個漂亮的數字,它衡量的是誤判少了多少;使用者有沒有因此更清楚自己遇到了什麼,這次更新沒有回答。