Claude Opus 5 上線:它會自己打開手機版檢查跑版
它自己把頁面在瀏覽器裡打開,切桌機寬度看一次、切手機寬度再看一次,抓到商品被壓在首屏底下、結帳按鈕跑出畫面外,兩個修好才交件。這是 Claude Opus 5 發表稿裡最值得停下來的一段。
Anthropic 在 7 月 24 日推出 Claude Opus 5。發表稿裡有一長串 benchmark,但最值得停下來看的是一段沒有任何數字的描述。
一家做前端評測的公司把網頁任務丟給 Opus 5。它自己把頁面在瀏覽器裡打開,切到桌機寬度看一次、再切到手機寬度看一次,抓到一個商品被壓在手機版首屏底下、一個結帳按鈕跑出了畫面外,兩個都修好才把工作交回來。
如果你做過網頁交付,你知道那是驗收流程裡最容易被跳過的一步。
Opus 5 從 7 月 24 日起在所有平台上線,價格跟前一代 Opus 4.8 一模一樣:每百萬 input token 五美元、output 二十五美元。它成為 Claude Max 的預設模型,也是 Claude Pro 上最強的選項。Anthropic 給它的定位是「接近 Fable 5 的前沿智慧,價格只要一半」。
在 Frontier-Bench 與 GDPval-AA 這類程式與知識工作評測上,Opus 5 是目前最強的一個;資安任務上仍落後 Mythos 5,這是 Anthropic 自己標注的邊界。分數的部分知道到這裡就夠了——對每天要交稿的人來說,真正會改變手感的東西在後面。
這次發表稿花了不少篇幅講「verifying its work」——模型會反覆檢查自己做出來的東西,直到過關才交件。舉的例子有點極端:有一個 Frontier-Bench 任務要模型看一張機械零件的工程圖、寫出 FreeCAD 的 3D 模型程式碼,題目卻故意不給模型任何看圖的管道。Opus 5 的反應是自己寫了一條電腦視覺處理流程,從原始像素把幾何資訊拉出來,然後把整個零件重建完成。同樣設定下,其他模型試五次都沒解出來。
開頭那個前端的例子更貼近日常。「有沒有東西掉出畫面」「手機版首屏有沒有把重點壓掉」這類問題本來就可以被機器檢查。過去你得自己把 breakpoint 切一遍,現在這道工序有機會外包出去。

還有一段值得單獨拿出來看。一位工程師描述他提了一個架構設計,Opus 5 當場反對;他堅持,模型也沒有順著改口——它說清楚他的想法哪一部分有價值、把反對意見收斂到單一個設計問題上,然後提出一個保留優點、修掉缺陷的折衷方案。
做過 design critique 的人對這個節奏應該很熟。願意在你堅持的時候把異議收窄到一個具體問題,而非整段收回,這是設計討論裡最貴的能力。
這次所有圖表都用同一種畫法:橫軸是每個任務花掉多少美元,縱軸是分數,每個模型畫成一條往右上爬的線。這條線是 effort setting 拉出來的——low、medium、high、xhigh、max 五段,由你決定要它想多久。

這張圖真正的訊息在曲線的位置。Opus 5 那條線整條壓在 Opus 4.8 上面,意思是同樣一塊錢買到的品質換了一個檔次。Zapier 的執行長講得更直白:Opus 5 就算開在最低的 effort,通過的商業任務數量還是比其他任何模型都多。
對每天在用的人,這件事的實際意義是:不必每個任務都開到最大。改一段文案、調一個 spacing 的建議,低檔的答案通常就夠用;跑一整套設計系統的一致性稽核、或是要它從頭盤一份提案,才值得開到 max 讓它慢慢磨。另外它多了一個 Fast mode,速度大約是預設的 2.5 倍,代價是兩倍價格。
Anthropic 說 Opus 5 能產出「明顯更強的視覺輸出」,並且放了兩個示範:一個可以調參數的風洞模擬,看氣流怎麼繞過流線型與非流線型的物體;一個可互動的細胞結構圖解。
這兩個示範有個共同點——它們都是用程式碼畫出來的東西。一位共同創辦人的評語更具體:同一批全端應用專案,最先看出差別的是前端,動畫、遊戲和 3D 的表現是他們看過 Opus 系列裡最好的。另一位做簡報產品的則說,最大的進步出現在長跨度的工作上:做完一整份 deck,然後改它;視覺理解更好、排版更乾淨、投影片出錯更少。
所以這裡講的「視覺變強」,指的是 render 出來會動、可以互動的介面、圖表和投影片。它能幫你把原型做到可以點、可以捲、可以在手機上真的操作一次,做不出可以交給印刷廠的稿。
這個區分對設計師滿重要的。如果你的產出是網頁、產品介面、互動原型、簡報,這一代的進步會直接落到你手上;如果你的產出是主視覺、包裝、印刷品,那這次的重點跟你的距離還很遠。同一則發表稿,兩種設計師讀到的訊息量差很多。
Anthropic 自己列了幾條邊界。生物研究上,長時間自主執行的研究任務仍有明顯限制,那類工作 Mythos 5 還是比較強;資安上,Opus 5 找漏洞的能力已經接近 Mythos 5,但把漏洞寫成可用 exploit 的能力差距還很大——這是刻意沒有訓練的結果。
從設計端看,還有兩件事發表稿沒有回答。
第一,所有評測都在量「做完了沒有」,沒有一項在量「做得好不好看」。開頭那個前端例子抓到的是商品被壓在首屏底下、按鈕跑到畫面外,那些是 bug。版面的節奏、留白的分寸、字級的層級,機器沒在看,也量不出來。
第二,安全分類器會在你不知情的狀況下把你降級。在 Claude.ai、Claude Code 和 Claude Cowork 裡,被標記的請求預設會 fallback 到 Opus 4.8。Anthropic 說攔截頻率大約比 Fable 5 少 85%,但只要踩到一次,你手上那個答案就換成 Opus 4.8 產生的了。做資安相關的視覺化、或處理生醫題材的內容時,這件事值得放在心上。
Opus 5 的定價跟上一代一樣,這件事本身就說明了 Anthropic 想要什麼——讓「用最好的模型」從專案級的奢侈變成日常選項。而真正改變工作節奏的是自我驗收那一段:模型願意在交件前多繞一圈,你接手時要修的東西就少一輪。
省下來的那一輪時間拿去做什麼,模型不會替你決定。