Figma 實測 AI 省時:設計工作快 20%,最大贏家卻是 PM
Figma 用醫學臨床試驗的方法,找 100 人量 AI 到底省多少時間。整體快 20%,但最大贏家是 PM,不是設計師。
你有沒有算過,用 AI 做一個介面,到底比不用快多少?
大部分人答不出來。感覺是快了,交件好像提前了,但快多少、快在哪個環節,說不清楚。Figma 的資料科學團隊決定把這件事量出來——他們找了 100 個人,設計了一場像醫學臨床試驗那樣嚴謹的實驗,只為了回答一個問題:Figma Make 到底幫設計師省了多少時間。答案是 20%。而真正有意思的,是誰省得最多。
AI 工具這兩年一直在縮短設計週期,把重複、機械的工作接過去,讓人專心在真正重要的地方。這幾乎是業界共識。但共識歸共識,很少有人把「省了多少」真的算成一個數字。
Figma 資料科學團隊一開始也只是假設 AI 會省時間。可是一旦要量化,麻煩就冒出來——手邊那幾套常用的統計方法,沒有一套能乾淨地回答這個問題。
問題出在「干擾因子」(confounder)——那些同樣會影響任務快慢、卻跟 AI 無關的變數。年資、經驗、任務本身的難度,每一個都會左右一個人做多快。
先看 A/B 測試。給一組人 Make、另一組關掉,再比誰做得快。聽起來隨機分組就能抵消干擾,但有個洞補不起來:你沒辦法保證兩組人手上的任務一樣難。
再看翻資料庫的因果推論。傾向分數配對(PSM)要求所有干擾因子都記在 log 裡,可是匿名的使用者 ID 根本不會告訴你這個人的設計功力有多深。工具變數(IV)則需要一個只影響「要不要用 AI」、又不碰其他東西的變數——Figma 的 log 裡壓根沒有這種東西。

排除掉前面那幾套,Figma 選了隨機對照試驗(RCT)——醫學驗證新藥時的黃金標準。它靠三件事把干擾因子壓住:把人隨機分到實驗組和對照組,讓年資、經驗大致平均分佈;讓所有人做一模一樣的任務,抹掉難度差異;再由受過訓練的主持人全程照著同一份腳本引導,減少過程中冒出來的變數。
樣本數 100 人,一半產品設計師、一半 PM。這個數字不是拍腦袋——他們參考了 GitHub Copilot 那幾份 RCT 觀察到的效果量,再跑功效分析回推出來。之所以只測 Make 一個工具,也是為了少放一個變數進來。
實驗的核心很單純:兩組人做同一批任務,唯一差別是實驗組能用 Make、對照組完全沒有 AI。
任務選什麼?第一考量是「所有人都懂」,不管設計底子深淺。最後定在編輯社群貼文。他們設計了三個場景,分別測 UI 與外觀調整、在既有設計上長出新畫面、加上互動與響應:把貼文改成深色模式、在設定選單加一個求助選項、做一個留言浮出的互動。
最難的一關,是讓任務落在一個「金髮女孩區」——對設計師不能太簡單,對 PM 又不能太難。他們找 Figma 內部的設計師和 PM 跑了好幾輪試測,把任務前後重寫三次才定案。
100 個人全部完成了實驗。整體來看,累積完成時間少了 20%,任務難易度的感受改善 16%,對 Figma 好不好用的評價提升 15%。
但拆開看才是重點。PM 在每一個面向的增益都穩定高過設計師——有 Make 的 PM,累積省下 23% 的時間。換算下來,一個用 Make 的 PM,效率幾乎追上一個沒用 Make 的設計師。
更細一層,兩種人省時間的地方剛好相反。PM 在最簡單、最快的兩個任務上有明顯增益,最難那個反而看不出差別;設計師恰恰倒過來,只有在最難的任務省到時間,簡單的那兩個沒有統計顯著。Make 對設計師是加速「從零到一」和複雜互動的引擎,對 PM 則是一塊讓他們能快速上手做點設計的基本盤。

這篇文章表面在講 Make 省了多少時間,底下其實藏著一堂研究方法課。當所有工具都在喊自己讓你更快,能分辨「這個數字怎麼來的」就變成一種本事。RCT 之所以敢說 Make「造成」了這些改善,是因為它從一開始就把干擾因子擋在門外——這跟隨便抓兩群人比一比,是兩回事。
對正在學設計的人,這裡有個更實際的提醒:你得先熟到知道一件事原本要花多久,才量得出 AI 幫你省了多少。底子,就是你判斷 AI 到底有沒有用的那把尺。

