Day 196#數據分析#行銷#電商

A/B 測試結果解讀器:兩版差 0.3%,先看樣本夠不夠再決定要不要換|AI101 Day 196

A 版轉換 3.2%、B 版 3.5%,會議上有人說換,有人說再等等,最後多半是憑感覺決定,再把結果寫成一份看起來很科學的報告。A/B 測試結果解讀器讓你填實驗名稱、測試天數,兩個變體各自的曝光、轉換、營收,先判斷樣本量夠不夠下結論,再算出信心水準落在 90%、95% 還是根本不顯著,把轉換率差距換算成一個月大概多賺或少賺多少,最後列出可能的誤判風險跟下一輪該測什麼。

📖 約 5 分鐘閱讀·2,180 字·2026/10/8

「B 版比較好,下週就全換吧。」會議上這句話講完,我問了一句:B 版總共幾個轉換?對方翻了一下,47 個,A 版 39 個,跑了四天。我說這個差距大概就是一個週末的流量波動而已,全場安靜了三秒。那次我其實也不確定自己對不對,回去用統計檢定算了一遍,差距的信心水準不到 70%,離能下結論的 95% 差得遠。

類似的場面我在不同公司看過很多次。不是大家不懂統計,是跑測試的人跟做決策的人通常不是同一個,中間傳遞的只剩「B 贏 20%」這種結論句,樣本多少、跑幾天、有沒有新奇效應,這些脈絡在轉述過程全掉了。

更尷尬的是我自己也做過一次「轉換率贏了但營收輸了」的改版。簡化結帳流程之後 CR 確實往上,但客單價掉了一截,總營收反而比舊版少。那時我只盯著 CR 一個數字,過了兩週才從財務報表發現不對。所以後來我看 A/B 結果一定看三個數:曝光、轉換、營收,缺一個都不敢下結論。

這個工具能做什麼

它的輸入欄位很直接:實驗名稱(例如商品頁排版 v2)、測試天數,然後變體 A(對照組)跟變體 B(實驗組)各填曝光、轉換、營收,最後是情境說明,寫你這次到底在測什麼、原本的假設是什麼。頁面會即時算出兩組的 CR 跟 B 相對 A 的差距百分比,按下「分析實驗結果」就進入判讀。

判讀分四塊。統計顯著性:它先看兩組的樣本量夠不夠支撐結論,不夠就直接告訴你還不能下定論,而不是硬給一個勝負。信心水準判讀:算出這個差距有多少機率不是運氣造成的,並標示落在 90%、95% 以上還是不顯著,讓你知道這個結論有多硬。ROI 預估:把轉換率差距乘上你的流量與營收資料,直接告訴你全面採用 B 版一個月大概多賺多少,判斷值不值得為它動工程。誤判風險:列出這次結果可能被什麼東西騙到,像是測試天數太短的新奇效應、節慶流量、或者轉換率贏但客單價輸的陷阱。

最後它會給下一輪實驗方向。如果這次不顯著,是該繼續跑,還是這個改動本來影響就太小,應該把力氣花在更大的變動上。

如果你手上還沒有實驗資料,先按「載入範例」看它怎麼判讀,不會耗掉 AI 額度。頁面上也有三個實際情境可以先看:測兩週商品頁排版、測三天 CTA 顏色、測結帳流程簡化,三種結果剛好對應「可以上」「樣本不足」「贏了也不要上」三種判讀,先看過會比較知道自己的測試落在哪一種。至於資料本身,它不會接你的網站,也不會替你跑測試,數字要從 GA4、廣告後台或電商平台的 A/B 功能撈出來填,它負責的是判讀那一段。

為什麼這件事值得做好

A/B 測試最貴的不是流量,是把運氣當成洞察。一個靠雜訊贏的 B 版上線之後,接下來三個月所有的優化都會建立在這個錯的基礎上,等到發現,已經不知道是哪一步走歪的。

我覺得很多團隊對 A/B 測試的焦慮來自「不顯著等於白做」這個誤解。其實不顯著是很有用的資訊,它告訴你這個改動對使用者來說沒差,那就不用再為它吵架,省下的時間去測別的。我手上的案子多半有一半以上的測試是不顯著收場,這很正常,真正值錢的往往是那一兩次清楚的顯著結果。

另一個容易被忽略的是測試成本。A/B 測試不是免費的,期間有一半的流量被送去可能比較差的版本,如果 B 版真的比較爛,那半個月的營收就是學費。所以「什麼時候該停」跟「什麼時候該換」一樣重要,工具的下一步建議就是在幫你算這個:繼續跑值不值得,還是該認賠停損。

還有一個我自己踩過的雷是測太短。三天就看到 B 贏 30%,很興奮,結果再跑一週差距縮到 5%,再一週變負的。新版本上線前幾天常有新奇效應,老客戶因為「不一樣了」多點幾下,不代表真的比較好。工具會在天數太短的時候跳警告,建議至少跑滿一個完整的週期。

幾個實際建議

第一,開跑之前先寫情境說明。「我覺得把加購按鈕放到價格旁邊會提高加購率,因為使用者看完價格就能直接行動」這種一句話的假設,會逼你想清楚這次測的是什麼。沒有假設的測試贏了也不知道為什麼贏,下次複製不了。我早期做過一堆「反正試試看」的測試,結果堆了一整個資料夾,回頭卻沒有一個能告訴我使用者到底在意什麼。

第二,曝光跟轉換是基本,營收能填就填。只填前兩個,它只能算 CR 的顯著性;加了營收它才看得出「CR 贏但客單價輸」這種陷阱,而這種陷阱是最容易被忽略的,我自己就是在這裡摔過。

第三,測試天數至少跨過一個完整的七天。台灣電商的週間跟週末流量結構差很多,週一到週四上班族偷看,週末才認真買,只測四天等於只看到一半的客群。如果期間剛好碰到發薪日、連假或平台大檔,最好把那幾天標在情境說明裡,判讀誤判風險的時候它才有脈絡可以參考。

第四,不顯著的時候,先問改動夠不夠大,再問要不要繼續跑。按鈕顏色這種小改動本來就很難測出差異,流量不大的站與其跑一個月去等它顯著,不如改測排版、價格呈現、或整個結帳流程這種看得出差別的東西。

小結

兩版差 0.3% 到底算不算贏,答案不是「算」或「不算」,是「在目前的樣本量下,這個差距有多少機率是真的」。這支工具把這句話算成一個數字,再幫你把數字換成錢,順便提醒你可能被什麼騙到。老實說,我以前有好幾次改版決定如果先過這一關,應該會少走不少冤枉路。

👉 立即使用:https://ecom.atmarketing.tw/ab-analyzer

🎯

立即實際體驗 A/B 測試結果解讀器|兩版差 3%,到底算不算贏

加入 AI101 挑戰平台,解鎖這個工具並拿到實用範本與教學。

❓ 常見問題

我要準備哪些數字?▾
每一版的曝光數(或造訪數)與轉換數就夠了。如果還知道客單價,它可以順便幫你把轉換率差距換算成實際的營收影響,判斷值不值得為它改版。
它說不顯著,代表 B 版比較差嗎?▾
不是,代表目前的資料量還分不出高下。這時候有兩個選擇:繼續跑到樣本足夠,或是承認這個改動影響太小、把力氣花在更大的變動上。不顯著本身就是有用的資訊。
為什麼要先看樣本量?▾
因為小樣本的波動很大。一天幾十個轉換就宣布勝負,很可能只是抓到一段運氣好的時段。先確認樣本足夠,結論才站得住。

📚 你可能也想看