為什麼買新裝置之前要先做一次螢幕測試
2026 年 9 月 1 日,我們把 Screen Test Pro 帶進香港的一家蘋果直營店,在時間允許的範圍內盡量多跑幾台帶螢幕的裝置:幾支新 iPhone、一台 iPad mini,以及一台 2025 年的 Mac Studio——不是最新款。這是一次有用的購買模擬,一間真實環境裡的基準測試實驗室,也出乎意料地成了揭露我們計分系統弱點的實地測試。
這趟走訪印證了一個樸素的想法:買新裝置之前,應該先測一測它的螢幕。 在瀏覽器裡花幾分鐘,就能發現觸控問題、色彩與漸層瑕疵、壞點、更新率的實際表現,以及瀏覽器的真實效能。它也給了你一套可重複的方法,把手上這台和下一款機型比較——或者和街對面的競品比較。
一次逛店變成了一次基準測試稽核
我們在走訪期間記下了六個分數:
| 裝置 | 實地得分 | 基準測試版本 |
|---|---|---|
| iPad mini(A17 Pro) | 3,186 | 2.1.0 |
| iPhone 17e | 4,275 | 2.1.0 |
| iPhone 17 | 5,696 | 2.1.0 |
| iPhone Air | 5,856 | 2.1.0 |
| iPhone 17 Pro Max | 6,118 | 2.1.0 |
| Mac Studio(2025) | 11,040 | 2.1.0 |
這些數字是一份歷史實地紀錄,不是當下的選購排名。表中每個分數都是用基準測試 2.1.0 取得的,也正是我們當時在店裡檢視的那個版本。從香港回來之後,我們把演算法升級到了 2.2.0。如果你當初是在 2.1.0 上測的,我們強烈建議你再跑一次效能測試:不同基準測試版本的分數絕不能互相比較,一份新鮮的 2.2.0 結果才是今天該出現在榜上的那一個。
有幾位蘋果直營店的店員停下來看我們做測試。他們稱讚這個網站看起來很專業,還說在有人買新裝置之前,這類檢查很容易推薦給顧客。那是店裡的人給出的慷慨而隨性的回饋——並非蘋果的正式背書——但它正好呼應了我們想鼓勵的行為:趁著還能和旁邊的替代機型對照,就去檢查你正在考慮的那一塊螢幕。
蘋果直營店的測試挖出了什麼
這趟走訪給了我們讚美給不了的東西:證據,證明基準測試在若干高階蘋果裝置之間給出了錯誤的相對關係。一組差異很大的 GPU 落在了彼此約百分之九的範圍內,而最強的硬體反而可能排在較弱的裝置下面。我們把這次撞車追溯到三個各自獨立的原因。
第一,通過規則對固定更新率與可變更新率的螢幕區別對待。固定的 60 Hz 面板只能在這一個更新間隔或下一個更新間隔呈現一格畫面;可變更新率的面板則能直接交回介於兩者之間的影格時間。舊的容差因此無意間讓其中一條顯示路徑比另一條更容易。基準測試 2.2.0 現在會先跑一次簡短的節奏探測,並套用一個能感知螢幕的通過門檻,同時保留 16.67 毫秒這個相同的效能預算。
第二,有一個場景把負載變動之後重新配置算圖目標的臨時開銷也算了進去。那些過渡影格並不是我們想量測的持續負載。現在它們會在統計繼續之前被丟棄。
第三,快速硬體已經越過了計分範圍的一部分。有兩個場景會在硬體遠未觸及真正效能上限之前就撞上一個平坦的分數天花板,把本該拉開差距的裝置壓在了一起。我們抬高了負載梯子,讓每個分數上限對齊場景可量測的天花板,並用未打折扣的硬體資料重新校準了參考負載。
完整的工程說明見 2.8.0 更新記錄,目前的計算方式記錄在計分方式。這裡的教訓比一次修正更寬:當實地證據證明一個基準測試的假設已經過時,它靠改變自己來贏得信任。
基準測試應該隨硬體一起演進
我們每天都會檢視送進來的效能證據和新硬體。當真實裝置暴露出天花板、偏差或過時的參考點時,演算法不會被當成不可觸碰的東西。我們會調查、寫明原因,並發布帶版本號的修正。
截至 2026 年 9 月 2 日,Screen Test Pro 目前的基準測試演算法是 2.2.0。你可以在首頁和每一張結果單上看到這個版本號。你也可以在更新記錄裡追蹤每一次公開變更,並在基準測試排行榜上查看目前的彙整結果。
這些更新背後有一條重要的紀律:參考負載在一個基準測試版本之內保持凍結。如果工作負載、通過標準或參考發生了會改變分數意義的變化,基準測試版本也會隨之改變,新的排行榜會開啟一套獨立的比較集合。持續改進應當提升可信度,而不是悄悄挪動球門。
正因如此,我們希望每一位手上拿著舊結果的讀者重新測一次。打開標準效能測試,確認開始卡片上寫著 v2.2.0,為你的裝置建立一條新的基準線。重跑既給你修正後的分數,也幫助目前的排行榜更準確地反映真實硬體。
一次螢幕測試能在付款前發現什麼
規格表描述的是一個型號。螢幕測試檢查的是你面前的這一台。
觸控回應與漏掉的區域
打開觸控螢幕測試,把整塊面板都劃過一遍,尤其是四角和邊緣。你要找的是延遲的筆畫、斷掉的線條、死區,以及不一致的多點觸控回應。這在新手機或平板上有用,買二手或整新機時更重要。
壞點、亮點與暗點
壞點測試會輪換整片純色,讓微小的瑕疵無法再躲在照片或應用程式介面裡。白、黑、紅、綠、藍這幾種背景會顯露不同的次像素故障。如果你在檢查一塊二手螢幕,二手螢幕檢查指南還會把殘影、壓痕和邊緣損傷加進清單。
色彩、漸層與均勻度
用漸層測試尋找色帶、偏色和不均勻的過渡。螢幕校色工具另外提供黑階、白階、對比與伽瑪的圖樣。這些檢查取代不了色度計,但能很快揪出一塊明顯不同於旁邊同款的面板。
更新率與動態表現
更新率測試會確認瀏覽器實際收到的是什麼。殘影測試有助於在動態中看出拖影、塗抹和過驅動的假影。這一點很重要,因為標稱高更新率的裝置可能正跑在省電模式,螢幕也可能被線材或連接埠限制住。
持續負載下的瀏覽器效能
效能測試會逐步抬高六個視覺場景,直到每一個都達到最大穩定負載,再把這些量測合成一個帶版本號的分數。這是理解瀏覽器—作業系統—GPU 整條鏈路在該裝置上表現的快速方法。它取代不了原生 GPU 實驗室,我們那篇瀏覽器基準測試能測到什麼的指南詳細說明了這條界線。
如何在店裡公平地比較裝置
店裡最好的比較方式是簡單且可重複的:
- 盡量使用同一個瀏覽器家族,關掉吃資源的背景應用程式,並記下每台裝置是否接著電源。
- 檢查兩份結果顯示的是同一個基準測試版本和同一個標準設定檔。
- 讓發熱的手機在效能測試前先涼下來。持續的 GPU 工作會產生熱量,熱降頻是真實的資訊——但不該把它和冷機峰值混為一談。
- 先做那些簡短的目視檢查:解析度、觸控、整片純色、漸層與動態。
- 儲存結果圖片或連結,然後在下一台裝置上重複同樣的順序。
正是最後一步讓這套方法的用處超出了單一品牌。在蘋果直營店測最新的 iPhone,再到隔壁用同一個版本測三星手機。把瀏覽器和條件盡量保持接近,除了總分也比較各項子分數,並把結果當成關於整條瀏覽鏈路的證據——而不是某顆晶片在每個應用程式裡都普遍更快的斷言。
現在花五分鐘,能省下好幾年的彆扭
一個壞點、一塊不可靠的觸控區域或一塊令人失望的面板,都是在付款之前最好處理。即使裝置毫無瑕疵,測試也能讓你比單純對比規格表更清楚地說出選這一款而不是另一款的理由。
在筆電或桌機上從完整螢幕測試開始,在手機上則用更聚焦的手機螢幕測試。如果你想要一個可比較的瀏覽器效能量度,再跑一次目前的效能基準測試。不需要安裝,也不需要帳號,測試就在你面前的這台裝置上執行。
在買下你可能要看好幾年的那塊螢幕之前,花五分鐘測一測它。 如果你在基準測試 2.2.0 上重跑了某台裝置,歡迎在下面留言,寫上型號、瀏覽器和結果。提問、對照和實地回報我們都歡迎——我們會讀,而下一次改進往往就是從那裡開始的。