为什么买新设备之前先做一次屏幕测试
2026 年 9 月 1 日,我们把 Screen Test Pro 带进香港的一家苹果零售店,在时间允许范围内尽可能多地跑了带屏幕的设备:几台新 iPhone、一台 iPad mini,以及一台 2025 年的 Mac Studio——不是最新款。这是一次有用的购买模拟,一间真实环境里的基准测试实验室,也出人意料地成了暴露我们计分系统弱点的实地测试。
这次走访印证了一个朴素的想法:买新设备之前,应该先测一测它的屏幕。 在浏览器里花几分钟,就能发现触控问题、色彩与渐变缺陷、坏点、刷新率的实际表现,以及浏览器的真实性能。它还给了你一套可重复的方法,把手里这台和下一款机型比较——或者和街对面的竞品比较。
一次逛店变成了一次基准测试审计
我们在走访期间记录了六个分数:
| 设备 | 实地得分 | 基准测试版本 |
|---|---|---|
| iPad mini(A17 Pro) | 3,186 | 2.1.0 |
| iPhone 17e | 4,275 | 2.1.0 |
| iPhone 17 | 5,696 | 2.1.0 |
| iPhone Air | 5,856 | 2.1.0 |
| iPhone 17 Pro Max | 6,118 | 2.1.0 |
| Mac Studio(2025) | 11,040 | 2.1.0 |
这些数字是一份历史实地记录,不是当下的选购排名。表中每个分数都是用基准测试 2.1.0 采集的,也正是我们当时在店里审视的那个版本。从香港回来之后,我们把算法升级到了 2.2.0。如果你当初是在 2.1.0 上测的,我们强烈建议你再跑一次性能测试:不同基准测试版本的分数绝不能互相比较,一份新鲜的 2.2.0 结果才是今天该出现在榜上的那一个。
有几位苹果零售店的店员停下来看我们做测试。他们称赞这个网站看起来很专业,还说在有人买新设备之前,这类检查很容易推荐给顾客。那是店里的人给出的慷慨而随意的反馈——并非苹果的正式背书——但它正好呼应了我们想鼓励的行为:趁着还能和旁边的替代机型对比,就去检查你正在考虑的那一块屏幕。
苹果零售店的测试挖出了什么
这次走访给了我们赞美给不了的东西:证据,证明基准测试在若干高端苹果设备之间给出了错误的相对关系。一组差异很大的 GPU 落在了彼此约百分之九的范围内,而最强的硬件反而可能排在更弱的设备下面。我们把这次撞车追溯到三个各自独立的原因。
第一,通过规则对固定刷新和自适应刷新的屏幕区别对待。固定的 60 Hz 面板只能在这一个刷新间隔或下一个刷新间隔呈现一帧;自适应面板则能直接交回介于两者之间的帧时间。旧的容差因此无意中让其中一条显示路径比另一条更容易。基准测试 2.2.0 现在会先跑一次简短的节奏探测,并应用一个感知显示器的通过阈值,同时保留 16.67 毫秒这一相同的性能预算。
第二,有一个场景把负载变化之后重新分配渲染目标的临时开销也算了进去。那些过渡帧并不是我们想测量的持续负载。现在它们会在统计继续之前被丢弃。
第三,快速硬件已经越过了计分范围的一部分。有两个场景会在硬件远未触及真实性能上限之前就撞上一个平坦的分数天花板,把本应拉开差距的设备压在了一起。我们抬高了负载梯子,让每个分数上限与场景可测量的天花板对齐,并用未打折扣的硬件数据重新校准了参照负载。
完整的工程说明见 2.8.0 更新日志,当前的计算方式记录在计分方式。这里的教训比一次修复更宽:当实地证据证明一个基准测试的假设已经过时,它靠改变自己来赢得信任。
基准测试应该随硬件一起演进
我们每天都会审阅送进来的性能证据和新硬件。当真实设备暴露出天花板、偏差或过时的参照点时,算法不会被当成不可触碰的东西。我们会调查、写明原因,并发布带版本号的修正。
截至 2026 年 9 月 2 日,Screen Test Pro 当前的基准测试算法是 2.2.0。你可以在首页和每一张结果单上看到这个版本号。你也可以在更新日志里追踪每一次公开变更,并在基准测试榜上查看当前的汇总结果。
这些更新背后有一条重要的纪律:参照负载在一个基准测试版本之内保持冻结。如果工作负载、通过标准或参照发生了会改变分数含义的变化,基准测试版本也会随之改变,新的榜单会开启一套独立的比较集合。持续改进应当提升可信度,而不是悄悄挪动球门。
正因如此,我们希望每一位手里拿着旧结果的读者重新测一次。打开标准性能测试,确认开始卡片上写着 v2.2.0,为你的设备建立一条新的基线。重跑既给你修正后的分数,也帮助当前的基准测试榜更准确地反映真实硬件。
一次屏幕测试能在付款前发现什么
规格表描述的是一个型号。屏幕测试检查的是你面前的这一台。
触控响应与漏掉的区域
打开触摸屏测试,把整块面板都划过一遍,尤其是四角和边缘。你要找的是延迟的笔画、断掉的线条、死区,以及不一致的多点触控响应。这在新手机或平板上有用,买二手或翻新设备时更重要。
坏点、亮点与暗点
坏点测试会轮换整屏纯色,让微小的缺陷无法再藏在照片或应用界面里。白、黑、红、绿、蓝这几种背景会暴露不同的子像素故障。如果你在检查一块二手屏幕,二手屏幕检查指南还会把残影、压痕和边缘损伤加进清单。
色彩、渐变与均匀度
用渐变测试寻找色带、偏色和不均匀的过渡。显示器校准工具另外提供黑位、白位、对比度和伽马的图案。这些检查代替不了色度计,但能很快揪出一块明显不同于旁边同款的面板。
刷新率与运动表现
刷新率测试会确认浏览器实际收到的是什么。残影测试有助于在运动中看出拖影、涂抹和过驱动伪影。这一点很重要,因为标称高刷新率的设备可能正运行在省电模式,显示器也可能被线材或接口限制住。
持续负载下的浏览器性能
性能测试会逐步抬高六个视觉场景,直到每一个都达到最大稳定负载,再把这些测量合成一个带版本号的分数。这是理解浏览器—操作系统—GPU 整条链路在该设备上表现的快速方法。它代替不了原生 GPU 实验室,我们那篇浏览器基准测试能测到什么的指南详细解释了这条边界。
如何在店里公平地比较设备
店里最好的比较方式是简单且可重复的:
- 尽量使用同一浏览器系列,关掉占资源的后台应用,并记录每台设备是否接着电源。
- 检查两份结果显示的是同一个基准测试版本和同一个标准配置。
- 让发热的手机在性能测试前先凉下来。持续的 GPU 工作会产生热量,热降频是真实的信息——但不应把它和冷机峰值混为一谈。
- 先做那些简短的目视检查:分辨率、触控、整屏纯色、渐变与运动。
- 保存结果图片或链接,然后在下一台设备上重复同样的顺序。
正是最后一步让这套方法的用处超出了单一品牌。在苹果零售店测最新的 iPhone,再到隔壁用同一个版本测三星手机。把浏览器和条件尽可能保持接近,除了总分也比较各项子分数,并把结果当作关于整条浏览链路的证据——而不是某颗芯片在每个应用里都普遍更快的断言。
现在花五分钟,能省下好几年的别扭
一个坏点、一块不可靠的触控区域或一块令人失望的面板,都是在付款之前最好处理。即便设备毫无瑕疵,测试也能让你比单纯对比规格表更清楚地说出选这一款而不是另一款的理由。
在笔记本或台式机上从完整显示器测试开始,在手机上则用更聚焦的手机屏幕测试。如果你想要一个可比较的浏览器性能量度,再跑一次当前的性能基准测试。不需要安装,也不需要账号,测试就在你面前的这台设备上运行。
在买下你可能要看好几年的那块屏幕之前,花五分钟测一测它。 如果你在基准测试 2.2.0 上重跑了某台设备,欢迎在下面留言,写上型号、浏览器和结果。提问、对比和实地报告我们都欢迎——我们会读,而下一次改进往往就是从那里开始的。