Screen Test Pro

Mil execuções do benchmark 2.5: o que o hardware realmente marca

Por Screen Test ProPublicado em

O benchmark 2.5.0 entrou no ar em 20 de setembro. Nas duas semanas seguintes, 1.065 pessoas o executaram e deixaram o resultado ser contado. É a primeira vez que uma versão deste benchmark fica parada tempo suficiente para reunir um número de execuções com quatro dígitos, então é a primeira vez que podemos dizer como as pontuações se parecem lá fora, e não só nas máquinas das nossas próprias mesas.

Tudo abaixo vem dessas execuções, de 20 de setembro a 3 de outubro. Os gráficos estão vivos: mude o recorte, mude o agrupamento, passe qualquer um deles para uma tabela. Se você executou o benchmark neste navegador, o primeiro gráfico já conhece a sua pontuação.

Metade das máquinas fica abaixo de 3.334

Das 1.065 execuções, 665 terminaram limpas, e são essas que os gráficos de pontuação usam. A mediana delas é 3.334. Um décimo fica abaixo de 636, um décimo acima de 13.583, e a melhor execução da quinzena foi 31.468.

Execuções completas por pontuação, em escala logarítmica: cada barra é cerca de um terço mais larga em pontuação do que a anterior. Digite uma pontuação para ver onde ela cai no recorte que você escolheu.

Os nomes dos níveis dividem essa população de forma mais uniforme do que esperávamos ao cortá-los: 19% Básico, 28% Equilibrado, 32% Rápido, 22% Extremo. Passados 20.000, fica solitário. Só 21 execuções chegaram lá, cerca de 3%.

A forma importa mais do que a mediana. Há uma corcova entre 400 e 1.300, um vale logo acima, e depois um platô longo de cerca de 1.800 até além de 13.000. Isso não é uma população de computadores. São duas: máquinas com gráficos integrados, e todo o resto.

A GPU decide quase tudo

Agrupe as execuções por família de GPU e as duas populações se separam.

A marca é a mediana, a barra é a metade do meio das execuções, a linha fina vai do 10º ao 90º percentil. Grupos com menos de 15 execuções ficam de fora.
Família de GPU Execuções completas Mediana Metade do meio
GeForce 207 9.204 6.116 – 13.156
Radeon 81 3.270 1.194 – 12.841
Apple silicon 134 3.128 2.132 – 4.257
Adreno 42 2.564 1.322 – 4.537
Intel integrado 130 973 632 – 1.796
Mali 31 785 533 – 1.307

Uma máquina GeForce típica marca cerca de nove vezes e meia uma típica com Intel integrado. A direção não vai surpreender ninguém. O tamanho vale a pena saber se você está decidindo se um notebook precisa da placa dedicada.

Radeon é a linha estranha. A metade do meio vai de 1.194 a 12.841, uma abertura de dez vezes, porque o nome cobre tanto os gráficos dentro de um chip de notebook Ryzen quanto uma placa de mesa que troca socos com a GeForce. Uma mediana Radeon não descreve nenhum dos dois. Estreite o gráfico para Radeon e agrupe por memória, e as metades se separam: 12.614 para máquinas com 17 GB ou mais, 2.496 para as de 9 a 16.

Apple silicon é o contrário: apertado. A metade do meio das execuções Apple fica entre 2.132 e 4.257, telefones, tablets e Macs juntos. Estreite para Apple e agrupe por sistema operacional, e a ordem é a que você adivinharia: Mac 3.961, iPad 3.451, iPhone 2.412. Um iPhone na mediana supera o telefone Android mediano em mais uma metade, e ganha do notebook Intel mediano por duas vezes e meia.

Nenhuma máquina ganha todas as cenas

O total esconde a parte mais interessante. O benchmark são seis cenas, cada uma apoiada numa parte diferente da máquina, e as famílias não mantêm a ordem de uma cena para a seguinte.

Cada célula é a mediana daquele grupo numa cena, como múltiplo da mediana de todas as execuções. Azul está acima do conjunto, âmbar abaixo.

A GeForce fica com as cenas que são GPU pura. Em Deriva nebular, um milhão de partículas atualizadas na placa de vídeo, a mediana dela é cinco vezes o conjunto e sete vezes a da Apple.

Depois olhe Cascata estelar. Essa cena é física calculada na CPU, em JavaScript, e a Apple a leva: uma mediana de 12.196 contra 9.394 da GeForce. Separado por sistema operacional, fica mais nítido. O Mac mediano marca 17.390 em Cascata estelar e o PC Windows mediano 7.729. O iPhone mediano, em 11.593, ganha do PC Windows mediano em física de CPU.

Canvas 2D segue o mesmo caminho. Os Macs registram uma mediana de 10.085 na cena dos círculos simples e as máquinas GeForce 4.448. Agrupado por navegador, a mediana do Safari ali é duas vezes e meia a do Chrome. Não é só o chip. É o chip mais um navegador cujo canvas 2D é muito rápido, que é o que encontramos no mês passado em um Mac com cinco navegadores e que agora aparece em algumas centenas de máquinas de desconhecidos.

Então uma pontuação só é um resumo justo e uma descrição ruim. Um Mac e um PC gamer de médio porte podem cair no mesmo total sem terem concordado em nada pelo caminho.

O que uma bateria realmente custa

Pegue cada execução de desktop e de notebook e separe por fonte de energia. Na tomada, a mediana é 4.697. Na bateria, 1.700. Parece que desligar da tomada custa quase dois terços do desempenho.

Não custa. Estreite o gráfico acima para GeForce e agrupe por fonte de energia: na bateria a mediana é 11.830, na tomada 9.207. Dezessete execuções na bateria são uma amostra fina, então não diríamos que a bateria é mais rápida, só que não há penalidade à vista. O Intel integrado diz o mesmo com mais execuções por trás: 1.061 na bateria, 964 na tomada.

A grande lacuna é sobre quem está desligado. Uma máquina na bateria é um notebook, e a maioria dos notebooks nesta amostra tem gráficos integrados. Compare igual com igual e a lacuna fecha. Se o seu próprio notebook marca bem mais baixo desligado, isso é o plano de energia dele, e vale uma olhada, mas não é a regra geral que o número do título sugere.

A mesma armadilha está no corte por taxa de atualização. Execuções em telas de 165 Hz ou mais têm mediana de 10.399, e execuções em telas de 60 Hz, 1.971. Um painel rápido não deixa a GPU mais rápida. Quem compra um monitor de 165 Hz também compra a placa para tocá-lo. Só dentro da GeForce a lacuna encolhe para 10.506 contra 6.609, e o que sobra são sobretudo placas mais novas atrás de monitores mais novos.

Mais uma, já que aparece. Entre as execuções GeForce, a mediana do Chrome é 10.583 e a do Edge é 8.683. Os dois são o mesmo motor. Lemos isso como quem usa qual navegador, e nada mais.

Quais máquinas terminam limpas

Uma execução é completa quando cada cena encontrou uma carga que a máquina conseguiu sustentar e provar. É limitada por calor quando a máquina mediu bem mas desacelerou ao esquentar. É degradada quando pelo menos uma cena não pôde ser medida direito. Em todas as 1.065 execuções: 62% completas, 25% limitadas por calor, 13% degradadas.

Todas as execuções enviadas, não só as completas. O número à direita é a parcela que terminou completa.

Máquinas GeForce quase nunca falham em medir: uma execução degradada em 269. Os iPhones são o grupo mais estável de todos, com 78% completas e uma única execução degradada em 64. Telefones Mali passam mais dificuldade, com 39% degradadas, e tablets como classe terminam completos menos da metade das vezes. Fino, sem ventoinha e quente é um lugar difícil para segurar uma carga estável por três minutos.

Um quarto das execuções limitadas por calor é mais do que gostaríamos. Parte disso é calor de verdade, e relatá-lo é o sentido da marca. Parte ainda é o benchmark fácil demais de desestabilizar, e é a próxima coisa em que estamos trabalhando.

As telas

Sessenta por cento das execuções vieram de telas de 60 Hz. O grupo seguinte não é 120 nem 144 Hz, e sim 165 Hz ou mais, com 21%, mais do que 120 e 144 juntos. A tela única mais comum ainda é 1920 × 1080 a 100% de escala, em 18% das execuções.

Como ler tudo isso

Estas são execuções de pessoas que acharam um site de teste de tela e escolheram apertar o botão. Não é uma pesquisa dos computadores do mundo. PCs gamer estão super-representados, e também gente que acabou de comprar algo e quer ver o que aquilo faz.

As pontuações vêm só de execuções completas, 665 delas. Um grupo precisa de 15 execuções antes de aparecer em qualquer gráfico, e é por isso que Linux, telas de 75 Hz e várias famílias de telefones faltam, em vez de aparecerem com um número que não poderíamos sustentar. Onde um grupo é pequeno, a contagem de execuções está impressa ao lado. Trate uma mediana de 20 execuções como uma pista.

O que guardamos de uma execução é curto: a pontuação, os seis resultados de cena, os números da tela e famílias grosseiras da GPU, do sistema operacional e do navegador. Sem endereço IP, sem país, sem identificador, nada que diga quem a executou. A página de privacidade tem a lista completa, e nada nesta página é mais fino do que essa lista.

Pontuações só se comparam dentro de uma versão do benchmark, então tudo isto descreve 2.5.0. Se você quer a sua máquina na próxima rodada de números, execute o benchmark. Leva cerca de três minutos, e como a pontuação é construída está escrito na página de metodologia.

Compartilhar esta página
DiscussãoUm tópico por idioma, compartilhado no site inteiro. Entre com o Google para publicar.
Discussão