Claude Opus 5 上線:它會自己打開手機版檢查跑版

它自己把頁面在瀏覽器裡打開,切桌機寬度看一次、切手機寬度再看一次,抓到商品被壓在首屏底下、結帳按鈕跑出畫面外,兩個修好才交件。這是 Claude Opus 5 發表稿裡最值得停下來的一段。

Introducing Claude Opus 5 | Anthropic 官方文章封面

Anthropic 在 7 月 24 日推出 Claude Opus 5。發表稿裡有一長串 benchmark,但最值得停下來看的是一段沒有任何數字的描述。

一家做前端評測的公司把網頁任務丟給 Opus 5。它自己把頁面在瀏覽器裡打開,切到桌機寬度看一次、再切到手機寬度看一次,抓到一個商品被壓在手機版首屏底下、一個結帳按鈕跑出了畫面外,兩個都修好才把工作交回來。

如果你做過網頁交付,你知道那是驗收流程裡最容易被跳過的一步。

SOURCE · ANTHROPIC NEWS
Introducing Claude Opus 5
Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
Anthropic · 2026.07.24
anthropic.com/news →
目錄 · CONTENTS
01先看清楚這次到底改了什麼
02它開始自己驗收,交回來的東西不一樣
03effort 這個旋鈕,把成本決定權交回你手上
04視覺輸出變強了,但要看清楚強在哪一段
05它沒解決的事
01/05先看清楚這次到底改了什麼

Opus 5 從 7 月 24 日起在所有平台上線,價格跟前一代 Opus 4.8 一模一樣:每百萬 input token 五美元、output 二十五美元。它成為 Claude Max 的預設模型,也是 Claude Pro 上最強的選項。Anthropic 給它的定位是「接近 Fable 5 的前沿智慧,價格只要一半」。

在 Frontier-Bench 與 GDPval-AA 這類程式與知識工作評測上,Opus 5 是目前最強的一個;資安任務上仍落後 Mythos 5,這是 Anthropic 自己標注的邊界。分數的部分知道到這裡就夠了——對每天要交稿的人來說,真正會改變手感的東西在後面。

02/05它開始自己驗收,交回來的東西不一樣

這次發表稿花了不少篇幅講「verifying its work」——模型會反覆檢查自己做出來的東西,直到過關才交件。舉的例子有點極端:有一個 Frontier-Bench 任務要模型看一張機械零件的工程圖、寫出 FreeCAD 的 3D 模型程式碼,題目卻故意不給模型任何看圖的管道。Opus 5 的反應是自己寫了一條電腦視覺處理流程,從原始像素把幾何資訊拉出來,然後把整個零件重建完成。同樣設定下,其他模型試五次都沒解出來。

開頭那個前端的例子更貼近日常。「有沒有東西掉出畫面」「手機版首屏有沒有把重點壓掉」這類問題本來就可以被機器檢查。過去你得自己把 breakpoint 切一遍,現在這道工序有機會外包出去。

Agentic computer use performance by effort level, OSWorld 2.0
OSWorld 2.0 量的是模型直接操作介面的能力——它自己開瀏覽器、自己切視窗,這條能力線就是上面那些行為的底層。圖片來源:Anthropic

還有一段值得單獨拿出來看。一位工程師描述他提了一個架構設計,Opus 5 當場反對;他堅持,模型也沒有順著改口——它說清楚他的想法哪一部分有價值、把反對意見收斂到單一個設計問題上,然後提出一個保留優點、修掉缺陷的折衷方案。

做過 design critique 的人對這個節奏應該很熟。願意在你堅持的時候把異議收窄到一個具體問題,而非整段收回,這是設計討論裡最貴的能力。

動手試 · 三個節拍
01
交件前先讓它自己看一遍
把做好的頁面丟回去,要求它切桌機、平板、手機三個寬度各檢查一次再回報
02
把驗收標準寫成清單
「首屏必須看到 CTA」「互動元素不得小於 44px」,讓它照表操課而不是憑感覺
03
讓它反對你一次
提案時明講「找出這個設計最弱的地方」,別急著要它同意你
03/05effort 這個旋鈕,把成本決定權交回你手上

這次所有圖表都用同一種畫法:橫軸是每個任務花掉多少美元,縱軸是分數,每個模型畫成一條往右上爬的線。這條線是 effort setting 拉出來的——low、medium、high、xhigh、max 五段,由你決定要它想多久。

Agentic coding by effort level, Frontier-Bench v0.1
Frontier-Bench v0.1 的成本/分數曲線。看的是整條線的位置,不是最高那一點。圖片來源:Anthropic

這張圖真正的訊息在曲線的位置。Opus 5 那條線整條壓在 Opus 4.8 上面,意思是同樣一塊錢買到的品質換了一個檔次。Zapier 的執行長講得更直白:Opus 5 就算開在最低的 effort,通過的商業任務數量還是比其他任何模型都多。

對每天在用的人,這件事的實際意義是:不必每個任務都開到最大。改一段文案、調一個 spacing 的建議,低檔的答案通常就夠用;跑一整套設計系統的一致性稽核、或是要它從頭盤一份提案,才值得開到 max 讓它慢慢磨。另外它多了一個 Fast mode,速度大約是預設的 2.5 倍,代價是兩倍價格。

動手試 · 三個節拍
01
先開低檔問一次
日常的改稿、命名、微調文案,低 effort 的答案往往已經可以用
02
量一次真實差距
拿一個你每週都做的任務,低檔跑一次、高檔跑一次,看差距值不值那個錢
03
把檔位寫進 SOP
哪類任務用哪一檔,寫下來,不要每次憑感覺決定
04/05視覺輸出變強了,但要看清楚強在哪一段

Anthropic 說 Opus 5 能產出「明顯更強的視覺輸出」,並且放了兩個示範:一個可以調參數的風洞模擬,看氣流怎麼繞過流線型與非流線型的物體;一個可互動的細胞結構圖解。

這兩個示範有個共同點——它們都是用程式碼畫出來的東西。一位共同創辦人的評語更具體:同一批全端應用專案,最先看出差別的是前端,動畫、遊戲和 3D 的表現是他們看過 Opus 系列裡最好的。另一位做簡報產品的則說,最大的進步出現在長跨度的工作上:做完一整份 deck,然後改它;視覺理解更好、排版更乾淨、投影片出錯更少。

所以這裡講的「視覺變強」,指的是 render 出來會動、可以互動的介面、圖表和投影片。它能幫你把原型做到可以點、可以捲、可以在手機上真的操作一次,做不出可以交給印刷廠的稿。

這個區分對設計師滿重要的。如果你的產出是網頁、產品介面、互動原型、簡報,這一代的進步會直接落到你手上;如果你的產出是主視覺、包裝、印刷品,那這次的重點跟你的距離還很遠。同一則發表稿,兩種設計師讀到的訊息量差很多。

其他更新 · 一次看完
價格
$5 / $25 每百萬 token,跟 Opus 4.8 相同;一般存取沒有資料保留要求
Fast mode
約 2.5 倍速度,價格為基礎版兩倍,Claude Code 內可用點數換
對話中換工具
beta。同一段對話裡改變可用工具,不會讓 prompt cache 失效
自動 fallback
beta。API 上被安全分類器攔下的請求可自動改走其他模型,而不是直接被擋
對齊表現
自動化行為稽核 2.3 分,Anthropic 近期模型中最低(數字越低越好)
資安邊界
找漏洞的能力接近 Mythos 5,把漏洞變成可用攻擊的能力仍落後一大截
05/05它沒解決的事

Anthropic 自己列了幾條邊界。生物研究上,長時間自主執行的研究任務仍有明顯限制,那類工作 Mythos 5 還是比較強;資安上,Opus 5 找漏洞的能力已經接近 Mythos 5,但把漏洞寫成可用 exploit 的能力差距還很大——這是刻意沒有訓練的結果。

從設計端看,還有兩件事發表稿沒有回答。

第一,所有評測都在量「做完了沒有」,沒有一項在量「做得好不好看」。開頭那個前端例子抓到的是商品被壓在首屏底下、按鈕跑到畫面外,那些是 bug。版面的節奏、留白的分寸、字級的層級,機器沒在看,也量不出來。

第二,安全分類器會在你不知情的狀況下把你降級。在 Claude.ai、Claude Code 和 Claude Cowork 裡,被標記的請求預設會 fallback 到 Opus 4.8。Anthropic 說攔截頻率大約比 Fable 5 少 85%,但只要踩到一次,你手上那個答案就換成 Opus 4.8 產生的了。做資安相關的視覺化、或處理生醫題材的內容時,這件事值得放在心上。

END整體觀察

Opus 5 的定價跟上一代一樣,這件事本身就說明了 Anthropic 想要什麼——讓「用最好的模型」從專案級的奢侈變成日常選項。而真正改變工作節奏的是自我驗收那一段:模型願意在交件前多繞一圈,你接手時要修的東西就少一輪。

省下來的那一輪時間拿去做什麼,模型不會替你決定。

「Claude Opus 5 checks its own work the way a real frontend developer would.」
— Anthropic, Introducing Claude Opus 5
KEY POINTS · 重點整理
Opus 5 於 7 月 24 日上線,價格跟 Opus 4.8 相同,成為 Claude Max 的預設模型。
最實際的改變在自我驗收:它會自己開瀏覽器切換桌機與手機寬度,抓出跑版再修好才交件。
effort 五段檔位讓成本變成可控變數,日常改稿開低檔,系統性稽核才開到 max。
所有評測都在量「有沒有做完」,沒有一項在量「好不好看」——視覺判斷還是你的工作。
AI 設計覺醒

訂閱制

AI 覺醒設計應用攻略|RAR 設計攻略訂閱方案

✦ AI 工具實測與工作流分享

✦ 設計師角度的 Prompt 技巧

✦ 每週精選 AI × 設計新知

了解訂閱方案 →