Novedades
De la más reciente a la más antigua. Cualquier cambio que altere las puntuaciones incrementa la versión del benchmark. RSS
2.9.0
Limitado por calor es una marca, no una descalificación2026-09-02
- Las pruebas que se limitan por calor ahora cuentan. Hasta hoy la tabla de mejores puntuaciones solo publicaba pruebas en las que el dispositivo nunca perdía velocidad; y un teléfono a los cien segundos de una prueba de GPU a plena carga siempre pierde velocidad, porque eso es lo que hacen los teléfonos. Resultado: ningún teléfono había llegado nunca a la tabla con el benchmark 2.2.0, y dieciséis de sus primeras veinte pruebas eran invisibles en silencio. Ahora una prueba en la que se midieron todas las escenas pero el dispositivo se calentó recibe un estado nuevo —limitado por calor— y entra en la tabla con esa palabra en su propia fila. La puntuación no ha cambiado en nada: la misma prueba da hoy el mismo número que ayer, así que la tabla conserva su historia y el benchmark 2.2.0 conserva su versión.
- Degradado sigue significando degradado. Una prueba en la que una escena no pudo medirse, o cuyo nivel no pudo confirmarse, sigue fuera de la clasificación: esa puntuación es un mínimo, y clasificar mínimos junto a máximos confundiría a todo el mundo. La tarjeta de resultados lo dice ahora con todas las letras, en vez de dejarte con la duda de si la herramienta se ha comido tu puntuación, y las marcas de cada escena explican qué ocurrió exactamente. Tu propio carril de la tabla trata «limitado por calor» igual que «completo», coloca la marca al principio de la fila (donde la pantalla estrecha de un teléfono no puede recortarla) y las pruebas degradadas conservan su puesto con una etiqueta honesta.
- Consejo antes, diagnóstico después. La tarjeta de inicio dice ahora lo que antes se callaba: un dispositivo caliente se limita y puntúa menos, así que dale un minuto si acabas de exigirle mucho; y si aun así se limita, la prueba se marca, no se descarta. Después de una prueba limitada por calor, la tarjeta sugiere el experimento evidente: en frío, enchufado, otra vez.
- La muestra ha aprendido sobre el calor. Las muestras compartidas (esquema v5) registran ahora por qué se marcó una escena y cuánto se había ralentizado el dispositivo al final de ella: una sola proporción, como 1,3. Ese es justo el dato de campo que necesitará una futura revisión del benchmark consciente del enfriamiento, reunido de forma honesta. La política de privacidad enumera los campos nuevos; como siempre, describen la prueba, no a ti.
- Tabla más fresca. Una puntuación enviada aparece ya en la tabla sin esperar cinco minutos: la página la actualiza en cuanto terminas y los demás dispositivos la ven en menos de un minuto.
2.8.0
Un árbitro justo y una escalera más alta2026-09-01
- Benchmark 2.2.0. Las puntuaciones se reinician; esto es lo que se gana a cambio. Una salida de campo puso tres buques insignia de Apple uno al lado del otro: un portátil M2 Max, un Mac Studio M4 Max y un portátil M5 Pro. El benchmark los separó por menos del 9%, con la GPU más potente por debajo. Respuesta equivocada, y con tres causas rastreables por separado: una regla de aprobación que favorecía a las pantallas de portátil, una escena que medía otra cosa y un techo de puntuación que el hardware real ya había superado. Las tres están corregidas más abajo. Corregirlas cambia todas las cifras, así que 2.2.0 estrena tabla; cómo funciona la puntuación explica el método completo, ya actualizado.
- El juez de aprobación entiende de pantallas. Un monitor fijo de 60 Hz solo puede presentar un fotograma a los 16,7 ms o a los 33,3 ms —nada intermedio—, mientras que un panel adaptativo de portátil devuelve un fotograma de 18 ms como exactamente eso. Las tolerancias antiguas dejaban que los paneles adaptativos navegaran a 55 fps mientras los monitores de escritorio tenían que sostener 60 de verdad: misma GPU, menos puntuación en un escritorio. Ahora una sonda de cadencia de unos 600 ms lee cómo devuelve fotogramas tu pantalla antes de la primera escena, y la regla de aprobación —como mucho un 5% de fotogramas por encima del umbral ajustado a esa cadencia, con media recortada dentro del presupuesto de 16,67 ms— hace que «sostiene 60 fps» signifique lo mismo en cualquier panel. Y si tu pantalla está atascada por debajo de 50 Hz (modo de bajo consumo, un cable a 30 Hz), la prueba se niega a ejecutarse y dice por qué, en lugar de juzgar una GPU mirando por el ojo de una cerradura.
- Liquid Chrome medía reservas de memoria, no raymarching. Cambiar su carga redimensiona el búfer de render, y el navegador carga ese coste a un único fotograma larguísimo, que caía dentro de la siguiente ventana de medición y tumbaba niveles que la GPU aguanta sin despeinarse. Por eso una M4 Max «medía» la mitad que una M2 Max. Los fotogramas inmediatamente posteriores a un cambio de carga ahora se descartan: la transición no es el trabajo que se quiere medir. En nuestra máquina de pruebas, la búsqueda corregida se estabiliza un 45% más arriba, en el nivel que el silicio sostiene de verdad.
- La puntuación ya no toca su techo antes que la medición. El antiguo límite plano de 20× congelaba dos escenas enteras en los mismos 20.000 en cualquier GPU rápida de Apple: un 38% de la puntuación, idéntico en toda una generación de chips. Los topes de cada escalera están ahora entre 6 y 14× por encima de la máquina más rápida medida hasta hoy (60,6 millones de puntos de nebulosa, 32 millones de instancias de ciudad, 180 muestras de raymarch por píxel), no cuestan nada hasta que un dispositivo se los gana, y la puntuación se recorta justo donde termina la escalera, ni un paso antes.
- Referencias recentradas sobre hardware real y sin frenos. Las escenas se normalizan de modo que la máquina ancla —una M2 Max en un banco de pruebas enchufado— puntúe 13.000 con las seis escenas coincidiendo dentro de un margen de pocos puntos porcentuales, en lugar de una misma máquina marcando 0,11× en una escena y 4,42× en otra. Los niveles se han recortado para la nueva escala y validado volviendo a puntuar todas las muestras de producción: Básico por debajo de 500, Equilibrado hasta 1.499, Rápido hasta 5.999 y Extremo a partir de 6.000.
- Las muestras compartidas llevan ahora las cifras en bruto. La carga estable máxima real de cada escena —la cifra que el recorte de puntuación borraba— y una clase aproximada de cadencia de pantalla (fija / adaptativa / desconocida) viajan ya con el resultado compartido. Eso es lo que leerá la próxima calibración, así que no dependerá de fotografiar una unidad de exposición en una Apple Store. No se ha añadido nada identificativo; la política de privacidad enumera todos los campos, como siempre.
2.7.1
Un puesto por máquina en la tabla2026-09-01
- La tabla de mejores puntuaciones da ahora una fila por perfil de máquina. El primer mes del benchmark 2.1.0 dejó el problema a la vista: diez puestos y casi todos decían «GeForce · Windows · Edge», varios de ellos demostrablemente el mismo par de ordenadores repitiendo la prueba una y otra vez. Las puntuaciones siguen sin llevar identificador de ningún tipo, así que la tabla agrupa las pruebas por lo que una máquina no puede cambiar de un intento a otro —GPU, sistema operativo, navegador y versión, núcleos de CPU, memoria, tipo de dispositivo— y muestra solo la mejor prueba de cada grupo. Repetir puede mejorar la fila que ya tienes; no compra una segunda. No se recoge nada nuevo y la política de privacidad no tuvo que crecer para permitirlo: se volvió más estricta.
- Las filas indican la versión del navegador. «Edge 152» en lugar de «Edge», tanto en las filas globales como en tu propio carril. La versión siempre formó parte de la muestra; mostrarla hace que dos máquinas distintas parezcan dos máquinas distintas.
2.7.0
Música en la galería, botones para compartir y niveles más justos2026-08-30
- La galería de efectos ya tiene música. Treinta temas originales para las 13 escenas, cada uno compuesto para lo que ocurre en pantalla. Abre una escena y pulsa ♪: la elección y el volumen se guardan en tu dispositivo. Nada se descarga hasta que la activas, y la prueba de rendimiento sigue en silencio para que las puntuaciones signifiquen lo mismo en todas partes. Hay más detalles en el artículo del blog.
- Hemos reajustado los niveles de puntuación. Los límites anteriores se fijaron cuando las puntuaciones no pasaban de unos 4.300 puntos. Benchmark 2.1.0 elevó el techo a 20.000 y, de pronto, la mitad de las pruebas acababa en «Extremo»: una etiqueta que había dejado de significar algo. Las nuevas bandas son múltiplos sencillos del equipo de referencia: menos de 1× es Básico, hasta 3× es Equilibrado, hasta 9× es Rápido y más de 9× es Extremo. Tu puntuación no ha cambiado; quizá sí la palabra que aparece junto a ella. Los detalles están en cómo funciona la puntuación.
- Ahora cada etiqueta de la tarjeta de resultados es un botón. Pulsa Extremo, degradado, desviación, limitado o fallido y aparecerá debajo una explicación breve de lo que significa para tu prueba. Incluye la etiqueta que más se malinterpreta: limitado significa que la búsqueda agotó su tiempo, así que el valor real es igual o superior al mostrado.
- Las páginas ya se pueden compartir. Sobre el pie de herramientas, artículos y publicaciones aparece una fila de botones: las redes principales, correo electrónico, un código QR para enviar el enlace al teléfono y un botón para copiarlo. Solo se cargan cuando te acercas al final de la página, así que esta sigue siendo igual de rápida.
- Los enlaces de idioma han pasado al final del pie. Cambiar de idioma es poco frecuente; ahora aparecen primero las pruebas y las páginas que visitas de verdad.
2.6.0
El benchmark deja de agotar la escala2026-08-29
- Benchmark 2.1.0: las puntuaciones vuelven a separarse. Cinco de las seis escenas Estándar alcanzaban el máximo de su propia escala de carga y comunicaban ese límite en lugar del límite del hardware; Cascada estelar lo hacía en el 98 % de las pruebas completas. Al quedar una sola escena con margen, equipos sin relación acababan con el mismo total: un teléfono Android, un PC con Windows y un Mac puntuaron exactamente 3.977. Ahora cada escena puede subir hasta dieciséis veces su carga de referencia y la búsqueda resuelve el límite con una precisión aproximada del 6 %, frente al 15 % anterior. Las cargas de referencia y los pesos no cambian, de modo que 1.000 conserva su significado. Las puntuaciones de 2.0.0 y 2.1.0 nunca se comparan; las tablas empiezan vacías y se rellenan durante los días siguientes.
- Dos escenas dejan de acaparar memoria. Deriva nebular e Hipernova reservaban desde el principio su máximo número de partículas en todos los dispositivos, aunque dibujaran muchas menos: 58 MB entre ambas, incluso en móviles y tabletas que nunca se acercaban al tope. Ahora repiten un búfer menor, usan la mitad de memoria y alcanzan un techo mucho más alto.
- Toda prueba termina con un resultado. En hardware incapaz de mantener el presupuesto de fotograma incluso con la carga mínima de una escena, el benchmark antes no registraba nada, se cerraba y devolvía a la página sin tarjeta ni explicación. Ahora muestra la puntuación que realmente midió, explica por qué tiene ese valor y no impide que se ejecute la última escena.
- Los dispositivos lentos se miden, no se abandonan. Por debajo de unos cuatro fotogramas por segundo, cada fotograma parecía una pausa aislada; el motor descartaba la medición y permanecía en la carga inicial hasta agotar el tiempo. Ahora reconoce una lentitud sostenida y baja la carga hasta encontrar una respuesta real.
- Tu prueba siempre tiene un sitio. El carril tú de la tabla de mejores puntuaciones mostraba la invitación a ejecutar el benchmark incluso justo después de hacerlo si la prueba resultaba degradada. Ahora enseña tu mejor resultado sea cual sea su estado, con una etiqueta honesta, al final de la tabla.
- Misma GPU, mismos píxeles. El tamaño interno de renderizado queda por fin limitado como siempre afirmó la metodología. Una pantalla 4K renderizaba cuatro veces más fragmentos que una 1080p con la misma carga nominal; esas puntuaciones no eran comparables y ahora sí lo son.
2.5.0
Mejores puntuaciones y una galería con controles2026-08-28
- Mejores puntuaciones. Las diez mejores pruebas completas de los últimos 30 días aparecen en la página de prueba de rendimiento y en la tarjeta de la página de inicio. Esta vez son pruebas individuales, no medianas: benchmarks de hardware responde «qué suele puntuar este hardware»; esta tabla, «qué lograron últimamente los más rápidos». Las filas conservan exactamente el nivel de detalle de la tarjeta de consentimiento y la política de privacidad lo deja por escrito. La tabla también tiene un carril tú: tu mejor prueba se inserta desde el historial local de este dispositivo, o reserva un sitio hasta que ejecutes el benchmark. Nada de ese carril se envía.
- La galería de efectos ya es una página. Las 13 escenas incluyen tres controles que el benchmark no ofrece: carga de partículas según la escala propia de la escena, velocidad de simulación hasta 0,1× y calidad interna hasta 2× la resolución nativa para presionar el fill rate. El modo libre no puntúa y three.js sigue cargándose solo cuando abres una escena destacada.
- Página de benchmarks interactiva. Un botón permite iniciar una prueba directamente desde la página de estadísticas: consulta la tabla y compara el dispositivo en el momento. El espacio de las tablas queda reservado para que no desplacen el contenido al cargarse.
- Pulido. El índice de pruebas de monitor tiene más aire; la tarjeta de benchmark de la página de inicio se centra en el botón de ejecución, que ahora respira con un pulso lento en espera —y permanece inmóvil si se ha pedido reducir el movimiento—; el enlace de puntuación se convirtió en un ⓘ que explica el método en el mismo lugar; la vista previa de la tarjeta de inicio gana un poco de margen.
2.4.0
Siete páginas nuevas y un menú de verdad2026-08-26
- La colección de pruebas se duplica. La prueba de pantalla táctil dibuja una cuadrícula multitáctil para descubrir zonas muertas y toques fantasma. La prueba de quemado alterna campos uniformes con un control de permanencia: despacio para inspeccionar, rápido para ejercitar la retención. La prueba de pantalla OLED recorre ocho diapositivas adaptadas a los fallos reales de OLED, desde el negro puro y los tonos casi negros hasta el desgaste por canal. La prueba de degradados y banding recibe una página propia.
- Páginas por tipo de dispositivo. La prueba de pantalla de TV explica cómo llevar cada patrón al televisor mediante navegador integrado, pestaña compartida o HDMI. La prueba de pantalla del móvil reúne una inspección de cinco minutos para teléfonos usados.
- Un solo mapa. La página Prueba de monitor ordena los doce instrumentos según la secuencia de una revisión completa.
- Un menú para el sitio. La barra superior incorpora un botón con todas las pruebas y páginas en tres columnas compactas; por fin hay navegación móvil. El pie enlaza todas las herramientas desde cada página.
- Modo Clásico accesible. Los ocho efectos de v1 ya formaban un benchmark Clásico puntuado —motor, perfil y traducciones—, pero nada lo iniciaba. La página de prueba de rendimiento ya incluye el botón. Las pruebas clásicas se puntúan localmente y nunca envían datos.
2.3.0
Cuatro instrumentos nuevos2026-08-26
- Cada prueba tiene su propia página. La frecuencia de actualización mide los Hz que realmente entrega la pantalla, con una banda de tiempos de fotograma en directo. El comprobador de resolución distingue los píxeles declarados de los físicos y calcula el PPI. La prueba de ghosting mueve bloques rayados a tres velocidades sobre cinco fondos. La calibración del monitor recorre nivel de negro, nivel de blanco, gamma y equilibrio de grises en cuatro pasos a pantalla completa, y deja claro cuándo solo sirve un colorímetro.
- Prueba de píxeles muertos más completa. Preguntas frecuentes reales —cuántos píxeles son aceptables, si se propagan— y enlaces a las pruebas nuevas.
- Dos guías nuevas. Calibrar a ojo y saber cuándo hace falta un colorímetro y ghosting, tiempo de respuesta y desenfoque de movimiento.
- Palabras que vuelven a estar separadas. Una peculiaridad de espacios en Astro unía palabras alrededor de enlaces al cambiar de línea. Se corrigió en todo el sitio y una prueba de regresión revisa cada página.
2.2.1
Todo el instrumento, en 14 idiomas2026-08-26
- El benchmark habla tu idioma. Tarjeta de inicio, HUD, hoja de resultados, historial de puntuaciones y ayudas de las herramientas: 87 cadenas traducidas por personas a los 13 idiomas distintos del inglés. Los nombres de las escenas ya estaban localizados; ahora también lo está todo lo que las rodea.
- Notas de los patrones localizadas. La indicación «qué observar» de cada patrón de emisión aparece ahora en el idioma de la página.
- Las herramientas relacionadas enlazan con su idioma. Los sitios asociados del pie llevan ahora a la versión equivalente, no siempre al inglés.
- Páginas locales más ligeras. Las páginas de inicio de cada idioma incluyen solo las cadenas que usan las herramientas, no toda la carga heredada.
- Corrección del progreso del HUD. La barra ya no se detiene durante la fase de búsqueda por intervalo.
2.2.0
Una tarjeta más ligera, una galería más viva y menos datos2026-08-23
- Se recopilan menos datos, no más. Las muestras ya no registran el país ni el idioma del sitio: la lista de campos se redujo (esquema v3), y la política de privacidad se acortó con ella.
- La tarjeta de inicio muestra para qué esperas. Una vista previa del resultado —puntuación, nivel y barras por escena— ocupa la parte superior; las notas técnicas quedan dentro de un desplegable «Más información». Una mirada basta para saber qué obtendrás al ejecutar la prueba.
- Las escenas destacadas se animan al pasar el cursor. Las 13 tarjetas de la galería muestran ahora una vista previa en movimiento. Las cinco destacadas animan sus pósteres en Canvas 2D, de modo que three.js sigue sin cargarse hasta que abres una escena.
- Nueva marca en la cabecera y una barra superior más discreta: la lectura de pantalla aparece únicamente en el panel «Esta pantalla».
- Preguntas frecuentes en la página de inicio. Ocho respuestas breves sobre píxeles muertos, banding, el significado de la puntuación y los datos enviados, cada una enlazada con una explicación más completa.
2.1.0
Las estadísticas de hardware entran en funcionamiento2026-08-23
- Página de benchmarks de hardware. Puntuaciones medianas por familia de GPU y de dispositivo Android, calculadas con muestras anónimas. Cada fila necesita al menos 30 muestras antes de publicarse; se usan medianas, así que una ejecución excepcional no compra una posición.
- El envío está activado por defecto. La tarjeta de inicio del benchmark incluye ahora una casilla marcada en lugar de dos botones, junto con una vista previa de los valores exactos que enviaría tu dispositivo. Desmárcala y no se enviará nada; la elección queda guardada. La política de privacidad se actualizó al mismo tiempo.
- Tres campos nuevos en las muestras (esquema v2): batería o corriente, formato del dispositivo y, solo en Android, una familia aproximada como «Galaxy S24». Los modelos poco frecuentes se agrupan por marca en el propio dispositivo; el nombre exacto del modelo nunca sale de él.
- Un benchmark cuyo tiempo puedes seguir. El HUD muestra ahora la escena 2/6, una barra de progreso general y una estimación aproximada del tiempo restante, con el nombre de la escena entre una y otra.
- El inicio funciona como en las demás herramientas. Al confirmar la tarjeta, se entra directamente en pantalla completa y comienza la primera escena.
- Las escenas destacadas hablan 14 idiomas. Deriva nebular, Metrópolis de neón, Cromo líquido, Cascada estelar e Hipernova tienen nombres y descripciones traducidos por personas en todos los idiomas, y la galería muestra las 13 escenas en todas partes.
- Página de inicio más concisa: menos texto y un botón Ejecutar más grande.
2.0.0
La reconstrucción2026-08-23Screen Test Pro se ha reconstruido desde cero. Las mismas URL, los mismos catorce idiomas y todo lo demás nuevo.
- Nuevo benchmark. Cinco escenas destacadas en WebGL2 (Deriva nebular, Metrópolis de neón, Cromo líquido, Cascada estelar e Hipernova), más los ocho efectos clásicos de v1, trasladados fielmente y puntuados por separado. Las puntuaciones llevan versión —este es el benchmark
2.0.0— y la metodología es pública.
- Medición real. Percentiles de tiempo de fotograma por ventanas estadísticas, una escala de carga adaptativa con histéresis, detección de desviación térmica y límites estrictos en cada estado. El benchmark se puede cancelar; no puede quedarse bloqueado.
- Estadísticas anónimas de hardware, con consentimiento desde el principio. Al terminar una prueba puntuada se puede enviar una muestra anónima. Antes de empezar se muestra la lista exacta de campos, omitir el envío requiere un solo clic y la política de privacidad se reescribió para reflejarlo.
- Nuevas páginas para las herramientas. La prueba de píxeles muertos y la prueba de rendimiento tienen ahora páginas propias con orientación útil.
- Nuevo diseño. Denso, oscuro por defecto y con aspecto de instrumento. La página muestra una lectura en directo de tu pantalla en lugar de un reclamo publicitario.
- Más rápido. HTML estático, sin runtime de framework ni fuentes web; el código de las escenas solo se carga cuando ejecutas una.