Figma 實測 AI 省時:設計工作快 20%,最大贏家卻是 PM

Figma 用醫學臨床試驗的方法,找 100 人量 AI 到底省多少時間。整體快 20%,但最大贏家是 PM,不是設計師。

Measuring Time Savings From Figma Make | Figma 官方文章封面

你有沒有算過,用 AI 做一個介面,到底比不用快多少?

大部分人答不出來。感覺是快了,交件好像提前了,但快多少、快在哪個環節,說不清楚。Figma 的資料科學團隊決定把這件事量出來——他們找了 100 個人,設計了一場像醫學臨床試驗那樣嚴謹的實驗,只為了回答一個問題:Figma Make 到底幫設計師省了多少時間。答案是 20%。而真正有意思的,是誰省得最多。

SOURCE · FIGMA BLOG
Measuring Time Savings From Figma Make
The Figma Data Science team assumed that AI saves users time—but quantifying it required a new approach to research design.
By Remy Stewart, Data Scientist · Figma · 2026.08.11
figma.com/blog →
目錄 · CONTENTS
01沒人認真量過的那個問題
02為什麼 A/B 測試和資料分析都靠不住
03借一套醫學方法:隨機對照試驗
04任務要落在「金髮女孩區」
05結果:快 20%,PM 才是最大贏家
四種量法 · 只有一種擋得住干擾
A/B 測試
能隨機分組,卻沒辦法保證兩組人手上的任務一樣難。
傾向分數配對 PSM
要求干擾因子全記在 log 裡,但匿名 ID 看不出一個人的設計功力。
工具變數 IV
需要一個只影響「用不用 AI」的變數,Figma 的 log 裡找不到。
隨機對照試驗 RCT ✓
隨機分組+統一任務+專人主持,一次把干擾擋在門外——最後選這個。
01 / 05
沒人認真量過的那個問題

AI 工具這兩年一直在縮短設計週期,把重複、機械的工作接過去,讓人專心在真正重要的地方。這幾乎是業界共識。但共識歸共識,很少有人把「省了多少」真的算成一個數字。

Figma 資料科學團隊一開始也只是假設 AI 會省時間。可是一旦要量化,麻煩就冒出來——手邊那幾套常用的統計方法,沒有一套能乾淨地回答這個問題。

TRY THIS · 動手試試
挑一個你最近常做的任務——切一版 dark mode、拉一組 component。下次做的時候按碼錶,用 AI 做一遍、不用 AI 做一遍。你會發現「感覺快很多」跟碼錶上的秒數,常常對不太起來。
02 / 05
為什麼 A/B 測試和資料分析都靠不住

問題出在「干擾因子」(confounder)——那些同樣會影響任務快慢、卻跟 AI 無關的變數。年資、經驗、任務本身的難度,每一個都會左右一個人做多快。

先看 A/B 測試。給一組人 Make、另一組關掉,再比誰做得快。聽起來隨機分組就能抵消干擾,但有個洞補不起來:你沒辦法保證兩組人手上的任務一樣難。

再看翻資料庫的因果推論。傾向分數配對(PSM)要求所有干擾因子都記在 log 裡,可是匿名的使用者 ID 根本不會告訴你這個人的設計功力有多深。工具變數(IV)則需要一個只影響「要不要用 AI」、又不碰其他東西的變數——Figma 的 log 裡壓根沒有這種東西。

TRY THIS · 動手試試
下次看到「用了某工具,效率提升 30%」這種宣稱,先問一句:有沒有控制任務難度和使用者經驗?沒有的話,這個 30% 很可能只是比較了兩群本來就不一樣的人。
Figma Make 研究任務一:把社群貼文從淺色改成深色模式
研究任務之一:把同一則社群貼文從淺色模式切成深色模式,設計師與 PM 都做得懂。
03 / 05
借一套醫學方法:隨機對照試驗

排除掉前面那幾套,Figma 選了隨機對照試驗(RCT)——醫學驗證新藥時的黃金標準。它靠三件事把干擾因子壓住:把人隨機分到實驗組和對照組,讓年資、經驗大致平均分佈;讓所有人做一模一樣的任務,抹掉難度差異;再由受過訓練的主持人全程照著同一份腳本引導,減少過程中冒出來的變數。

樣本數 100 人,一半產品設計師、一半 PM。這個數字不是拍腦袋——他們參考了 GitHub Copilot 那幾份 RCT 觀察到的效果量,再跑功效分析回推出來。之所以只測 Make 一個工具,也是為了少放一個變數進來。

TRY THIS · 動手試試
RCT 的精神可以借來設計你自己的小實驗:想比較兩個工作流哪個快,先把「任務」和「起點」都固定住,只留下工具這一個變數。變數愈少,你得到的答案愈可信。
04 / 05
任務要落在「金髮女孩區」

實驗的核心很單純:兩組人做同一批任務,唯一差別是實驗組能用 Make、對照組完全沒有 AI。

任務選什麼?第一考量是「所有人都懂」,不管設計底子深淺。最後定在編輯社群貼文。他們設計了三個場景,分別測 UI 與外觀調整、在既有設計上長出新畫面、加上互動與響應:把貼文改成深色模式、在設定選單加一個求助選項、做一個留言浮出的互動。

最難的一關,是讓任務落在一個「金髮女孩區」——對設計師不能太簡單,對 PM 又不能太難。他們找 Figma 內部的設計師和 PM 跑了好幾輪試測,把任務前後重寫三次才定案。

TRY THIS · 動手試試
設計可用性測試或作品集案例時,這個「金髮女孩區」很好用:任務太簡單,看不出高下;太難,資料全被卡關汙染。難度剛好卡在中間,訊號才乾淨。
誰用 MAKE 省最多?(累積省時)
產品設計師
20%
產品經理 PM
23%
PM 在每個面向的增益都穩定高過設計師。一個用 Make 的 PM,效率幾乎追上一個沒用 Make 的設計師。
05 / 05
結果:快 20%,PM 才是最大贏家

100 個人全部完成了實驗。整體來看,累積完成時間少了 20%,任務難易度的感受改善 16%,對 Figma 好不好用的評價提升 15%。

但拆開看才是重點。PM 在每一個面向的增益都穩定高過設計師——有 Make 的 PM,累積省下 23% 的時間。換算下來,一個用 Make 的 PM,效率幾乎追上一個沒用 Make 的設計師。

更細一層,兩種人省時間的地方剛好相反。PM 在最簡單、最快的兩個任務上有明顯增益,最難那個反而看不出差別;設計師恰恰倒過來,只有在最難的任務省到時間,簡單的那兩個沒有統計顯著。Make 對設計師是加速「從零到一」和複雜互動的引擎,對 PM 則是一塊讓他們能快速上手做點設計的基本盤。

Figma Make 研究結果:完成時間少 20%、任務難易度改善 16%、好用度提升 15%
研究三個核心數字:累積完成時間 ↓20%、任務難易度感受 ↑16%、Figma 好用度評價 ↑15%。
— /
整體觀察

這篇文章表面在講 Make 省了多少時間,底下其實藏著一堂研究方法課。當所有工具都在喊自己讓你更快,能分辨「這個數字怎麼來的」就變成一種本事。RCT 之所以敢說 Make「造成」了這些改善,是因為它從一開始就把干擾因子擋在門外——這跟隨便抓兩群人比一比,是兩回事。

對正在學設計的人,這裡有個更實際的提醒:你得先熟到知道一件事原本要花多久,才量得出 AI 幫你省了多少。底子,就是你判斷 AI 到底有沒有用的那把尺。

「In the sum total of the experiment, a product manager using Make was almost as efficient as a product designer who didn’t use Make.」
— Remy Stewart, Data Scientist, Figma
KEY POINTS · 重點整理
Figma 資料科學團隊用 100 人的隨機對照試驗(RCT),量化 Figma Make 到底省多少時間。
A/B 測試、傾向分數配對、工具變數都因為擋不住干擾因子而出局,RCT 才是黃金標準。
整體結果:完成時間少 20%、任務難易度改善 16%、對 Figma 的好用度評價升 15%。
最大贏家是 PM——累積省時 23%,一個用 Make 的 PM 幾乎追上沒用 Make 的設計師。
省時的位置剛好相反:設計師在最難的任務省到,PM 在最簡單的任務省到。
100 種 Figma 設計的方法|UI/UX 線上課程
FIGMA 全攻略
要量得出 AI 幫你省多少,得先熟到知道原本要花多久
把 component、variables、Auto Layout 練成肌肉記憶,你才分得清哪段是 AI 幫的、哪段是自己的底。
AI 覺醒設計應用攻略|RAR 設計攻略訂閱方案
AIWAKEN 訂閱制
AI 覺醒設計應用攻略
✦ AI 工具實測與工作流分享
✦ 設計師角度的 Prompt 技巧
✦ 每週精選 AI × 設計新知