Ce qu’un benchmark GPU dans le navigateur peut et ne peut pas mesurer
Nous fabriquons un benchmark de navigateur : prenez donc cet article comme un fabricant qui imprime volontairement les effets secondaires sur l’étiquette. Un score GPU dans le navigateur est une vraie mesure de quelque chose de réel — mais ce quelque chose n’est pas ce que mesure 3DMark, et prétendre le contraire est la façon dont les chiffres de benchmark se transforment en astrologie.
Ce que le chiffre contient réellement
Quand notre test de performances annonce que votre machine a tenu 600 000 particules à une fréquence d’images stable, ce chiffre est le produit d’une longue chaîne :
- le silicium du GPU, évidemment ;
- le pilote, et les couches d’adaptation que le navigateur pose par-dessus ;
- le compositeur du navigateur, qui décide du moment où vos images atteignent l’écran ;
- JavaScript et son ramasse-miettes, sur les scènes qui sollicitent le processeur ;
- le gestionnaire d’énergie du système, qui décide seconde après seconde des fréquences auxquelles vous avez droit ;
- la thermique — châssis, courbe de ventilation, et le temps écoulé depuis votre dernier test ;
- et tout le reste qui tourne : vos 40 onglets, la visioconférence, l’analyse antivirus de l’après-midi.
Un benchmark natif court-circuite volontairement plusieurs maillons de cette chaîne pour isoler le matériel. Un benchmark de navigateur les conserve, et cela coupe dans les deux sens.
Là où un score de navigateur est le mauvais outil
Classer des GPU d’un système à l’autre. La même carte graphique peut obtenir des scores sensiblement différents selon le navigateur, la version du pilote ou le système, parce que le navigateur est une couche de traduction : les appels WebGL sont réécrits vers l’API native qui se trouve dessous (Metal sur macOS, Direct3D sur Windows). Pour savoir si un modèle de GPU en vaut un autre, lisez un test natif : c’est l’instrument adapté.
Prédire des FPS absolus dans les jeux. Un moteur de jeu qui a derrière lui des semaines d’optimisation ne se comporte pas comme un canevas de navigateur. Un score de navigateur est vaguement corrélé aux performances en jeu ; il ne les prédit pas.
Les écarts serrés. Lancez n’importe quel benchmark de navigateur cinq fois et vous obtiendrez gratuitement une dispersion de quelques pour cent. Les différences à l’intérieur de cette dispersion sont du bruit. Nous signalons les tests dégradés par la chaleur et vous laissons voir le détail par scène précisément pour que de petits écarts ne soient pas sur-interprétés.
Là où un score de navigateur est exactement le bon outil
Mesurer ce que le web peut réellement exploiter. Si ce qui vous intéresse est la sensation qu’auront les applications web lourdes, les outils sur canevas, les cartes et les sites WebGL sur un appareil, les couches de traduction ne sont pas une erreur de mesure : elles sont le phénomène. Un benchmark natif ne peut pas voir une régression de navigateur qui divise par deux vos performances réelles ; un benchmark de navigateur vit dedans.
Comparer votre machine à elle-même. Même appareil, même navigateur, avant et après une mise à jour de pilote, une montée de version du système ou un ralentissement suspect : c’est là que les benchmarks de navigateur excellent, parce que tout est tenu constant sauf ce que vous avez changé. Votre historique de scores reste sur votre appareil exactement pour cet usage.
Comparaisons à grande échelle sur la même chaîne. Dix mille exécutions de la même charge numérotée, regroupées par famille de GPU, produisent des médianes véritablement utiles : ce qu’un MacBook à puce M ou un Android de milieu de gamme délivre habituellement dans un navigateur. C’est le jeu de données que construisent nos échantillons anonymes, avec des seuils avant toute publication.
Un tri immédiat sur du matériel qui ne vous appartient pas. Aucune installation, aucun droit administrateur, cela fonctionne sur le portable d’occasion que vous inspectez ou sur la machine verrouillée du bureau. Un test que vous pouvez réellement lancer vaut mieux qu’un meilleur test que vous ne pouvez pas lancer. (À ce propos : la routine d’examen d’écran d’occasion.)
Comment nous gardons notre chiffre honnête
Les détails sont dans le calcul du score, mais voici la discipline en bref :
- Des temps d’image, pas un compteur de FPS. Nous jugeons les temps d’image sur des fenêtres de plusieurs secondes, en comptant les images manquées face à un budget qui tient compte de la cadence de l’écran plutôt qu’en les noyant dans une moyenne ; un benchmark qui gomme les saccades mesure du marketing.
- Un budget d’image figé. 16,67 ms quelle que soit la fréquence de rafraîchissement de votre écran, pour qu’un portable 120 Hz ne soit pas puni d’avoir une meilleure dalle.
- Des charges numérotées. Le moindre changement dans ce qu’une scène dessine incrémente la version du benchmark, et les scores ne se comparent jamais d’une version à l’autre.
- La dégradation signalée, pas diluée. Si l’appareil ralentit en cours de test (le plus souvent à cause de la chaleur), le résultat le dit au lieu d’absorber discrètement le bridage dans votre chiffre.
- Pas de déguisement en laboratoire. Le score s’appelle un score de charge de travail en navigateur, parce que c’est ce qu’il est.
Obtenir un chiffre qui mérite d’être gardé
Fermez ce que vous pouvez, branchez l’appareil, coupez l’économiseur de batterie, laissez la machine refroidir et ne touchez à rien pendant le test : la charge en arrière-plan et la thermique sont les deux plus grandes sources de variation que nous observons. Puis lancez-le deux fois et faites davantage confiance au second : le premier a payé les frais de mise en température.