模型會在你不知情時被換掉:Fable 5 生物防護放寬 85%

同一個帳號、同樣的問法,答案品質忽然掉一階。Anthropic 這次調整生物學防護,順手把「模型靜默降級」這個機制講清楚了。

Improving Fable 5 Safeguards | Anthropic 官方文章封面

用 AI 用久的人大概都有過這種時刻:同一個帳號、同樣的問法,昨天答得漂亮,今天突然變得含糊又保守。多數時候我們會怪尖峰時段、怪自己 prompt 寫壞了,換個講法再試一次就算了。

8 月 7 日 Anthropic 發了一篇公告,替其中一種情況給出了具體答案——你的請求可能根本沒有送到你以為的那顆模型。這篇公告表面上在講生物學防護鬆開了多少,底下藏著的是一個所有人都會遇到、卻幾乎沒被講清楚過的機制:模型的靜默降級。

SOURCE · ANTHROPIC NEWS
Improving Fable 5 Safeguards
We’re making updates to Claude Fable 5’s biology safeguards in a way that substantially reduces fallbacks.
Anthropic · 2026.08.07
anthropic.com/news →
目錄 · CONTENTS
01這次到底調了什麼
02fallback 是什麼,為什麼你可能早就遇過
03先封死再放寬:一個出貨順序的選擇
04它還沒解決的事
1/4這次到底調了什麼

先講數字。Anthropic 重新調校了 Fable 5 的生物學安全分類器,讓生物相關的 fallback 在各產品線平均下降約 85%。過去會被擋下來的那些日常問題——判讀檢驗報告的數值、搞懂某個症狀代表什麼、單純想弄清楚一段生物學知識——現在大多會放行。醫療專業人員在臨床任務上,也能拿到比以前更多的協助。

比 85% 更值得看的,是公告腳註裡那四個數字。把所有觸發原因加總,總 fallback 的降幅分別是:Claude.ai 約 67%、Cowork 約 55%、Claude Code 約 17%、Claude Platform 約 7%。同一次更新,落到四個介面上差了將近十倍。

這組數字其實是在替你回答「這件事關不關我的事」。你平常主要待在哪個介面工作,就對照哪個數字。習慣在 Claude.ai 裡查資料、整理訪談逐字稿、寫產品說明的設計工作者,會是體感最明顯的一群;而在 Claude Code 裡切版寫前端的人,可能整年都不會注意到有什麼不同。

2/4fallback 是什麼,為什麼你可能早就遇過

Anthropic 用的防護方式是安全分類器(safety classifier):一顆比主模型小很多的自動化系統,站在前面判斷這個請求有沒有落在受保護的生物任務範圍。一旦它觸發,Fable 5 不會拒絕你——請求會被重新導向到 Opus 5,一顆同樣好用、但生物能力沒那麼強的模型。使用者看到的「fallback」,講的就是這件事。

關鍵在後半段:這個轉手是靜默的。介面不會告訴你「這則請求已改由另一顆模型處理」,你唯一能感覺到的訊號,是答案的質地變了。從安全設計的角度,沉默是合理的——如果系統明確指出是哪一句話觸發了分類器,等於免費送出一份繞過指南。但站在使用者這邊,這是一種幾乎無法 debug 的體驗:你不知道該修的是問法、是主題,還是這件事本來就不該在這裡問。

做產品的人遲早會撞上同一個題目。系統在背後做了保護性的降級,要不要讓使用者知道?講清楚等於教人繞過,完全不講,使用者只會覺得你的東西不穩。Anthropic 選了沉默那一邊,然後把力氣全部押在減少誤判上——重寫分類器,而非在介面上多加一行提示。這個取捨值得記下來:當你沒辦法解釋一個限制的時候,剩下的路就是讓那個限制少發生。

動手試 · 三個節拍
01
先確認是不是被轉走
答案突然變保守時,換一個明顯無關的主題再問一次,比對品質有沒有回來
02
把敏感詞換成情境
與其問機制與原理,先講清楚用途和交付物,讓意圖落在良性那一側
03
記下失敗的那句
把觸發降級的問法存起來,下次直接繞開,不用每次重新猜
3/4先封死再放寬:一個出貨順序的選擇

公告裡最誠實的一段,是他們承認 Fable 5 上線時「幾乎封鎖了所有生物查詢」,而且是刻意的。他們知道這會製造大量 false positive、會讓正當的生物學使用者非常挫折,還是選了這個 tradeoff——因為 dual-use 領域一旦被濫用,代價可能是災難性的。另一條路是壓著模型不出、等防護做完再說,那會讓所有人晚幾週到幾個月才用得到。

過去幾週他們做的事,是把分類器的 constitution 重寫一遍。那是一組規則,用來幫這顆小模型分辨什麼算受保護、什麼算放行,這次重寫特別把良性用途一項一項切出來;接著找內部與外部的專家給意見,依照新規則產生訓練資料、重新訓練,再驗證它對有害與 dual-use 內容仍然會觸發。官方那張圖把這件事畫得很清楚。

Anthropic 官方圖:Fable 5 生物學分類器邊界,A 為上線時、B 為本次更新後
官方示意圖:分類器邊界從 A 往右移到 B,中間那塊「幾乎確定良性、但保險起見仍擋下」的 safety margin 被壓薄了一大截。圖片來源:Anthropic

這是一個很具體的「先上線再收斂」版本。多數人談 MVP,談的是功能砍到剩幾個;這裡砍的是規則的鬆緊度。預設值先壓在保守那一端,讓東西能出門,再拿真實流量把邊界一格一格往回推。設計系統的元件約束、權限預設、內容審核規則,都能照這個順序走——前提是你真的會回來調,別把過度保守當成永久設定。

4/4它還沒解決的事

先講擋住的部分。dual-use 的三大類——virology、toxicology、molecular design——現在仍然全數 fallback,所以 Fable 5 到今天依然不適合拿來做專業生物研究和新藥開發。Anthropic 說這個缺口會用 trusted access pathway 來補,但那是還沒到貨的東西。分類器的 false positive 也不會歸零,safety margin 裡那些風險極低、卻還是會被擋下來的請求,官方直說「必然仍會存在」。

對設計工作者來說,真正要留意的是另外兩件事。第一,如果你手上有醫療、健康、生技類的案子——醫學插畫、症狀說明的介面文案、衛教內容——你會落在邊界的哪一側,很大程度取決於你怎麼描述用途。同樣一張圖,說「畫一張衛教手冊用的呼吸道解剖示意」和說「描述病毒進入細胞的分子步驟」,在分類器眼裡是兩個世界。把交付物和使用情境講在前面,等於直接把判斷依據遞過去。

第二,這篇公告從頭到尾沒有提到任何使用者端的可見性。沒有說會在介面上標記,也沒有提到 API 會回傳這次是否經過降級。把 Claude 接進正式工作流的人,目前只能靠答案品質反推,這個觀測缺口這次更新沒有處理。

動手試 · 醫療類專案三個節拍
01
先報用途
開頭一句話交代這份東西給誰看、印在哪裡,再說你要什麼
02
拆掉機制詞
把「原理」「機制」「合成」這類詞,換成實際交付物的描述
03
留一組對照
同一個需求記下成功與失敗兩種問法,往後醫療類專案直接沿用
數字與邊界 · 一次看完
生物類 fallback
各產品線平均下降約 85%,是這次更新的主數字。
Claude.ai
總 fallback 降約 67%,四個介面裡體感最明顯的一個。
Cowork
總 fallback 降約 55%。
Claude Code
總 fallback 降約 17%,本來就很少人在這裡問生物問題。
Claude Platform
總 fallback 降約 7%。
現在放行
檢驗報告判讀、症狀理解、教科書等級的生物學與醫學內容。
仍然擋下
virology、toxicology、molecular design 等 dual-use 研究。
整體觀察

把生物學那層拿掉之後,這篇公告在講的是一件更普通的事:當一個系統為了安全必須降級,它同時也放棄了一部分可解釋性。Anthropic 這次選擇用調準分類器把體驗換回來,而非用告知。85% 是個漂亮的數字,它衡量的是誤判少了多少;使用者有沒有因此更清楚自己遇到了什麼,這次更新沒有回答。

“We intentionally launched Fable 5 with almost all biology queries blocked.”
— Anthropic, Improving Fable 5’s biology safeguards
KEY POINTS · 重點整理
生物相關 fallback 下降約 85%。判讀檢驗報告、理解症狀、教科書等級的生物學問題,現在大多會放行。
fallback 的真實機制是靜默重新導向——分類器一觸發,請求就交給 Opus 5 處理,介面上不會有任何提示。
dual-use 三類仍然全擋,而且這次公告沒有給出任何讓使用者知道自己被降級的方法。
AI 設計覺醒

訂閱制

AI 覺醒設計應用攻略|RAR 設計攻略訂閱方案

✦ AI 工具實測與工作流分享

✦ 設計師角度的 Prompt 技巧

✦ 每週精選 AI × 設計新知

了解訂閱方案 →