Qué puede medir un benchmark de GPU en el navegador y qué no
Construimos un benchmark para navegadores; considera este artículo como un fabricante que imprime voluntariamente los efectos secundarios en la etiqueta. Una puntuación de GPU en el navegador es una medición real de algo real, pero ese algo no coincide con lo que mide 3DMark. Fingir lo contrario convierte los números en astrología.
Qué contiene realmente la cifra
Cuando nuestra prueba de rendimiento dice que el equipo sostuvo 600.000 partículas con un ritmo estable, la cifra es producto de una cadena larga:
- el silicio de la GPU, por supuesto;
- el controlador y las capas del navegador que lo rodean;
- el compositor del navegador, que programa cuándo llegan los fotogramas a la pantalla;
- JavaScript y su recolector de basura en las escenas que presionan la CPU;
- el gestor de energía del sistema, que decide cada segundo qué frecuencia de reloj mereces;
- la temperatura: chasis, curva del ventilador y cuánto tiempo ha pasado desde la última prueba;
- y todo lo demás en ejecución: cuarenta pestañas, una videollamada, el análisis vespertino del antivirus.
Un benchmark nativo evita varios eslabones a propósito para aislar el hardware. Uno de navegador los conserva, y eso tiene dos caras.
Cuándo una puntuación web es la herramienta equivocada
Ordenar GPU entre sistemas. La misma tarjeta puede puntuar de forma apreciablemente distinta según navegador, controlador o sistema, porque el navegador es una capa de traducción: las llamadas WebGL se reescriben para la API nativa inferior —Metal en macOS, Direct3D en Windows—. Si quieres saber qué modelo de GPU supera a otro, consulta una prueba nativa; ese es el instrumento correcto.
Predecir FPS absolutos en juegos. Un motor de juego con semanas de optimización no se comporta como un canvas web. La puntuación de navegador guarda una correlación general con los juegos; no los pronostica.
Márgenes pequeños. Ejecuta cualquier benchmark web cinco veces y obtendrás gratis una dispersión de varios puntos porcentuales. Las diferencias dentro de ella son ruido. Marcamos las pruebas degradadas por temperatura y mostramos resultados por escena para que no se interpreten en exceso separaciones pequeñas.
Cuándo una puntuación web es exactamente la herramienta correcta
Medir lo que la web puede utilizar. Si te importa cómo funcionarán aplicaciones web pesadas, herramientas canvas, mapas y sitios WebGL, las capas de traducción no son un error de medición: son el fenómeno. Una prueba nativa no ve una regresión del navegador que reduce a la mitad el rendimiento real; una prueba web vive dentro de ella.
Comparar una máquina consigo misma. Mismo dispositivo y navegador, antes y después de actualizar el controlador, el sistema o una ralentización sospechosa. Aquí los benchmarks web destacan, porque todo permanece constante salvo lo que cambiaste. El historial de puntuaciones se queda en el dispositivo precisamente para este uso.
Comparaciones con la misma cadena a gran escala. Diez mil pruebas de la misma carga con versión, agrupadas por familia de GPU, producen medianas útiles: lo que suele ofrecer un MacBook serie M o un Android de gama media dentro de un navegador. Nuestras muestras anónimas construyen ese conjunto y no publicamos un grupo hasta alcanzar un umbral suficiente.
Diagnóstico inmediato de hardware ajeno. No instala nada, no necesita permisos de administrador y funciona en el portátil usado que inspeccionas o en un equipo de oficina bloqueado. Una prueba que puedes ejecutar gana a otra mejor que no puedes. Consulta también la rutina para dispositivos usados.
Cómo mantenemos honesta la cifra
Los detalles están en Cómo funciona la puntuación, pero la disciplina se resume así:
- Tiempos de fotograma, no contadores de FPS. Evaluamos el percentil 95 de los tiempos en ventanas de varios segundos; una prueba que diluye los tirones en una media mide marketing.
- Presupuesto fijo. 16,67 ms sin importar la frecuencia de la pantalla, para no penalizar a un portátil de 120 Hz por tener un panel mejor.
- Cargas con versión. Cualquier cambio en lo que dibuja una escena incrementa la versión; las puntuaciones nunca se comparan entre versiones.
- La degradación se señala, no se mezcla. Si el dispositivo baja su rendimiento durante la prueba —normalmente por calor—, el resultado lo dice en vez de promediarlo en silencio.
- Sin disfraz de laboratorio. La cifra se llama puntuación de carga de navegador porque eso es lo que es.
Obtener una cifra que merezca guardarse
Cierra lo que puedas, conecta el equipo, desactiva el ahorro de batería, deja que se enfríe y no hagas nada durante la prueba. La carga en segundo plano y la temperatura son las mayores fuentes de variación. Después ejecútala dos veces y confía más en la segunda: la primera pagó el calentamiento.