A/B 測試結果解讀器:貼上兩版的曝光、轉換與營收,看清 B 版是真贏還是運氣|AI101 Day 186
A 版轉換率 3.0%,B 版 3.6%,看起來 B 贏了 20%,但樣本只跑了五天、兩組加起來不到四千次曝光,這個差距到底站不站得住腳?我手上多數客戶的做法是憑感覺拍板,然後把一個其實沒比較好的版本推全量。A/B 測試結果解讀器讓你填入變體 A 與變體 B 各自的曝光、轉換、營收與測試天數,算出信心水準,標出樣本不足、天數不夠這類誤判風險,再推估 ROI 與下一輪方向,讓你用數字決定要不要全量。
前陣子一個客戶在 LINE 上丟給我一張後台截圖,附兩行字:「B 版贏了,下週全量」。我把圖放大看,A 版轉換率 3.0%,B 版 3.6%,差 0.6 個百分點,換算成相對提升是 20%,數字漂亮到讓人想直接按下去。但再往下看,測試只跑了五天,兩組加起來的曝光不到四千,B 版的轉換大概六十幾筆。我回他一句:「照這個樣本量,我不敢說它不是運氣。」
他當然不開心,因為這兩個禮拜設計師改按鈕、工程師改結帳流程,大家都想要一個結論。我懂那個心情,我自己早年也幹過一樣的事:看到相對提升兩位數就全量,兩個月後回頭看,整體轉換率一點都沒動,才知道那次的「贏」是週末流量結構不一樣造成的。
A/B 測試最貴的從來不是跑測試的時間,是跑完之後讀錯結論,然後拿錯的結論去改產品。A/B 測試結果解讀器就是幫你在按下全量之前,把那幾分鐘的統計功課做掉。
這個工具能做什麼
它要的數字不多,而且都是你後台本來就有的。最上面一欄「情境說明(測什麼?hypotheses)」寫一句你在測什麼,這句會影響後面判讀的方向,別留空。接著是變體 A(對照組)與變體 B(實驗組)兩組,各自填曝光、轉換、營收三個數字:曝光是看到這一版的人次(你後台可能叫訪客或造訪,兩組用同一個口徑就好),轉換是完成目標的次數,營收是這組帶進來的金額。再填測試天數,按「分析實驗結果」。它會先算出兩版的轉換率與相對差距,再給信心水準,白話翻譯就是「這個差距有多大的把握不是隨機造成的」。頁面寫得很直接:95% 才算顯著,低於這條線,就代表還要再跑,或是兩版其實差不多。
第二層是誤判風險。頁面標的基準是每組最少 1,000 個獨立訪客、100 次轉換,測試建議至少跑滿 7 天、一個完整的週循環,前三天常有「新奇效應」造成的偽陽性。你的數字如果沒到這些門檻,它會在結果旁邊把風險標出來,例如樣本不足、天數不夠、兩組流量結構可能不一致。這些提醒比顯著性本身更常救到人。
第三層是 ROI 推估與下一步。因為你填了營收,它能把「B 版多 0.6 個百分點」翻成金額,也抓得到「轉換率贏但總營收輸」這種陷阱:B 版讓更多人下單,但客單價掉了,整體反而賠。最後它會給一段下一輪實驗方向的建議:全量、再跑幾天,還是放棄這個方向換個更大膽的改動。這支工具是 AI 判讀,登入後每天有免費額度;還沒有自己的數據可以先按「載入範例(不耗 AI 額度)」看它怎麼解讀,看懂欄位再填自己的。
為什麼這件事值得做好
我覺得 A/B 測試在台灣電商圈有一個很尷尬的位置:大家都知道要做,做了之後卻幾乎沒有人真的看信心水準。多數後台只給你兩個轉換率並排,沒有告訴你這兩個數字的差距在目前的樣本量下有多不穩。於是決策變成誰的聲音大誰贏,數據只是拿來背書。
另一個被低估的成本是「假贏」會污染後面所有判斷。你把一個其實沒有效果的版本推全量,接下來三個月每次轉換率波動,團隊都會往那次改版找原因,真正該測的東西反而排不進去。我的經驗是,一次假贏造成的時間浪費,往往比多跑一週測試貴好幾倍。
反過來說,不顯著也不是白測。不顯著代表這個改動的影響力小到目前樣本偵測不出來,這本身就是結論,告訴你這個方向不值得繼續投資源,可以換一個幅度更大的改動。
還有一件事我想講清楚:95% 這條線是慣例,不是物理定律。它的意思是你願意接受二十次裡有一次看走眼。對一個改按鈕文案的小測試,我覺得 90% 就可以動了,反正改回來成本很低;但如果是要改整個結帳流程、牽動金流與工程排程的大改版,我會要求看到 95% 以上。工具給的是數字,門檻要拉多高,還是要看你這次改動翻車的代價有多大。
老實說,我自己到現在看到相對提升 20% 還是會心跳加快一下,這是人性。所以我才需要一個工具在旁邊潑冷水。
幾個實際建議
第一,兩組的流量來源要一致,這件事工具幫不了你。如果 A 版吃的是自然流量、B 版那幾天剛好有廣告導入,再漂亮的信心水準都沒有意義,因為你比的不是版本,是客群。工具可以提醒你兩組流量結構可能不一致,但分流設定對不對,還是要自己回後台看。
第二,跑滿一個完整的週循環再按分析。台灣電商的週間與週末行為差很多,上班日中午滑手機跟週日晚上躺在沙發上下單是兩種人。頁面建議至少 7 天,我自己的習慣是遇到檔期(雙 11、母親節前後)就直接跳過,等流量恢復正常再測,不然你測到的是檔期不是版本。
第三,營收那一欄填這組實際帶進來的金額,不要填預估。我看過有人拿旗艦品三千多的價格乘上轉換數填進去,算出來一個月多賺十幾萬,結果真實客單價只有一千出頭,收益連工程師那兩週的薪水都不夠。這一欄填實的,「轉換率贏但營收輸」的陷阱才抓得出來,ROI 推估也才能拿來比較「值不值得改」,而不是拿去寫在簡報上當業績目標。
第四,把每一次的結果留下來,包含不顯著的。一份「我們測過什麼、結果如何」的清單,半年後會比任何單次測試都值錢,因為它會告訴你哪一類改動在你的客群身上從來沒有用過。同一個「免運門檻提示」前後測了三次,每次都不顯著,第三次才有人翻出舊紀錄說我們早就測過了。
小結
A/B 測試的價值不在跑,在讀。把變體 A 與變體 B 的曝光、轉換、營收和測試天數貼進去,看信心水準、看風險提醒、看 ROI,然後才決定要不要全量。幾分鐘的功課,省下的是把錯的版本推給所有人之後,再花三個月回頭找原因的時間。