Mille exécutions du benchmark 2.5 : ce que le matériel marque vraiment
Le benchmark 2.5.0 est sorti le 20 septembre. Dans les deux semaines qui ont suivi, 1 065 personnes l’ont lancé et ont laissé le résultat être compté. C’est la première fois qu’une version de ce benchmark reste immobile assez longtemps pour réunir un nombre d’exécutions à quatre chiffres, et donc la première fois que nous pouvons dire à quoi ressemblent les scores dehors, et pas seulement sur les machines de nos propres bureaux.
Tout ce qui suit vient de ces exécutions, du 20 septembre au 3 octobre. Les graphiques sont vivants : changez la tranche, changez le regroupement, passez n’importe lequel en tableau. Si vous avez lancé le benchmark dans ce navigateur, le premier graphique connaît déjà votre score.
La moitié des machines est sous 3 334
Sur les 1 065 exécutions, 665 se sont terminées proprement, et ce sont celles qu’utilisent les graphiques de score. Leur médiane est 3 334. Un dixième est sous 636, un dixième au-dessus de 13 583, et la meilleure exécution de la quinzaine a été 31 468.
Les noms de paliers découpent cette population plus également que nous ne l’attendions en les coupant : 19 % Débutant, 28 % Équilibré, 32 % Rapide, 22 % Extrême. Passé 20 000, cela se vide. Seules 21 exécutions y sont arrivées, environ 3 %.
La forme compte plus que la médiane. Il y a une bosse entre 400 et 1 300, un creux juste au-dessus, puis un long plateau d’environ 1 800 jusqu’au-delà de 13 000. Ce n’est pas une seule population d’ordinateurs. Ce sont deux : des machines sur graphique intégré, et tout le reste.
Le GPU décide de presque tout
Regroupez les exécutions par famille de GPU et les deux populations se séparent.
| Famille de GPU | Exécutions terminées | Médiane | Moitié centrale |
|---|---|---|---|
| GeForce | 207 | 9 204 | 6 116 – 13 156 |
| Radeon | 81 | 3 270 | 1 194 – 12 841 |
| Apple silicon | 134 | 3 128 | 2 132 – 4 257 |
| Adreno | 42 | 2 564 | 1 322 – 4 537 |
| Intel intégré | 130 | 973 | 632 – 1 796 |
| Mali | 31 | 785 | 533 – 1 307 |
Une machine GeForce typique marque environ neuf fois et demie une machine typique à Intel intégré. La direction ne surprendra personne. La taille vaut d’être connue si l’on décide si un portable a besoin de la carte dédiée.
Radeon est la ligne étrange. Sa moitié centrale va de 1 194 à 12 841, un écart d’un facteur dix, parce que le nom couvre à la fois le graphique intégré à une puce de portable Ryzen et une carte de bureau qui tient tête à GeForce. Une médiane Radeon ne décrit ni l’un ni l’autre. Resserrez le graphique sur Radeon et groupez par mémoire, et les moitiés se séparent : 12 614 pour les machines avec 17 Go ou plus, 2 496 pour celles de 9 à 16.
Apple silicon est l’inverse : serré. La moitié centrale des exécutions Apple se tient entre 2 132 et 4 257, téléphones, tablettes et Mac ensemble. Resserrez sur Apple et groupez par système d’exploitation, et l’ordre est celui que l’on devine : Mac 3 961, iPad 3 451, iPhone 2 412. Un iPhone à la médiane dépasse le téléphone Android médian de moitié encore, et bat le portable Intel médian de deux fois et demie.
Aucune machine ne gagne chaque scène
Le total cache la partie la plus intéressante. Le benchmark compte six scènes, chacune appuyée sur une partie différente de la machine, et les familles ne gardent pas leur ordre d’une scène à l’autre.
GeForce possède les scènes qui sont du GPU pur. Dans Dérive nébulaire, un million de particules mises à jour sur la carte graphique, sa médiane est cinq fois le champ et sept fois celle d’Apple.
Regardez ensuite Cascade d’étoiles. Cette scène est de la physique calculée sur le CPU, en JavaScript, et Apple la prend : une médiane de 12 196 contre 9 394 pour GeForce. Séparé par système d’exploitation, c’est plus net. Le Mac médian marque 17 390 dans Cascade d’étoiles et le PC Windows médian 7 729. L’iPhone médian, à 11 593, bat le PC Windows médian en physique CPU.
Canvas 2D va dans le même sens. Les Mac affichent une médiane de 10 085 sur la scène des cercles simples et les machines GeForce 4 448. Groupé par navigateur, la médiane de Safari y est deux fois et demie celle de Chrome. Ce n’est pas la puce seule. C’est la puce plus un navigateur dont le canvas 2D est très rapide, ce que nous avions trouvé le mois dernier sur un Mac avec cinq navigateurs et qui se voit maintenant sur quelques centaines de machines d’inconnus.
Un score unique est donc un résumé juste et une mauvaise description. Un Mac et un PC de jeu de milieu de gamme peuvent tomber sur le même total sans s’être accordés sur rien en chemin.
Ce qu’une batterie coûte vraiment
Prenez chaque exécution de bureau et de portable et séparez-la par source d’alimentation. Branché, la médiane est 4 697. Sur batterie, 1 700. On dirait que débrancher coûte presque les deux tiers de la performance.
Ce n’est pas le cas. Resserrez le graphique ci-dessus sur GeForce et groupez par source d’alimentation : sur batterie la médiane est 11 830, branché 9 207. Dix-sept exécutions sur batterie forment un échantillon mince, donc nous ne dirions pas que la batterie est plus rapide, seulement qu’aucune pénalité n’est visible. L’Intel intégré dit la même chose avec plus d’exécutions derrière : 1 061 sur batterie, 964 branché.
Le grand écart porte sur qui est débranché. Une machine sur batterie est un portable, et la plupart des portables de cet échantillon ont un graphique intégré. Comparez semblable avec semblable et l’écart se referme. Si votre propre portable marque bien plus bas débranché, c’est son plan d’alimentation, et cela vaut un regard, mais ce n’est pas la règle générale que le chiffre du titre suggère.
Le même piège est dans la séparation par taux de rafraîchissement. Les exécutions sur des écrans de 165 Hz et plus ont une médiane de 10 399, et celles sur des écrans à 60 Hz de 1 971. Un panneau rapide ne rend pas le GPU plus rapide. Les gens qui achètent un moniteur 165 Hz achètent aussi la carte pour le piloter. Dans GeForce seul, l’écart se réduit à 10 506 contre 6 609, et ce qui reste, ce sont surtout des cartes plus récentes derrière des moniteurs plus récents.
Une de plus, puisqu’elle revient. Parmi les exécutions GeForce, la médiane de Chrome est 10 583 et celle d’Edge 8 683. Les deux sont le même moteur. Nous lisons cela comme qui utilise quel navigateur, et rien de plus.
Quelles machines finissent proprement
Une exécution est terminée quand chaque scène a trouvé une charge que la machine pouvait tenir et prouver. Elle est bridée quand la machine a bien mesuré mais a ralenti en chauffant. Elle est dégradée quand au moins une scène n’a pas pu être mesurée correctement. Sur les 1 065 exécutions : 62 % terminées, 25 % bridées, 13 % dégradées.
Les machines GeForce n’échouent presque jamais à mesurer : une exécution dégradée sur 269. Les iPhone sont le groupe le plus stable de tous, avec 78 % terminées et une seule exécution dégradée sur 64. Les téléphones Mali ont le plus de mal, avec 39 % dégradées, et les tablettes comme classe finissent terminées moins de la moitié du temps. Mince, sans ventilateur et chaud est un endroit difficile pour tenir une charge stable pendant trois minutes.
Un quart des exécutions bridées, c’est plus que nous ne voudrions. Une part est de la vraie chaleur, et la signaler est le sens du drapeau. Une part est encore le benchmark trop facilement déstabilisé, et c’est la prochaine chose sur laquelle nous travaillons.
Les écrans
Soixante pour cent des exécutions venaient d’écrans à 60 Hz. Le groupe suivant n’est pas 120 ou 144 Hz mais 165 Hz et plus, à 21 %, plus que 120 et 144 réunis. L’écran unique le plus courant reste 1920 × 1080 à 100 % de mise à l’échelle, sur 18 % des exécutions.
Comment lire tout cela
Ce sont des exécutions de gens qui ont trouvé un site de test d’écran et choisi d’appuyer sur le bouton. Ce n’est pas une enquête sur les ordinateurs du monde. Les PC de jeu sont surreprésentés, et aussi les gens qui viennent d’acheter quelque chose et veulent voir ce que cela fait.
Les scores viennent uniquement des exécutions terminées, 665 d’entre elles. Un groupe a besoin de 15 exécutions avant d’apparaître dans un graphique, c’est pourquoi Linux, les écrans à 75 Hz et plusieurs familles de téléphones manquent, plutôt que d’être montrés avec un nombre que nous ne pourrions pas assumer. Là où un groupe est petit, son nombre d’exécutions est imprimé à côté. Traitez une médiane tirée de 20 exécutions comme un indice.
Ce que nous gardons d’une exécution est court : le score, les six résultats de scène, les nombres de l’écran, et des familles grossières pour le GPU, le système d’exploitation et le navigateur. Pas d’adresse IP, pas de pays, pas d’identifiant, rien qui dise qui l’a lancée. La page de confidentialité a la liste complète, et rien sur cette page n’est plus fin que cette liste.
Les scores ne se comparent qu’au sein d’une version du benchmark, donc tout ceci décrit 2.5.0. Si vous voulez votre machine dans le prochain tour de chiffres, lancez le benchmark. Il prend environ trois minutes, et la façon dont le score est construit est écrite sur la page de méthodologie.