GitHub ha lanzado este 5 de octubre de 2026 ReviewBench, un benchmark abierto para medir la calidad real de los agentes de inteligencia artificial que revisan código. La compañía ha construido el sistema tras analizar la distribución de 103,9 millones de pull requests y ha creado un corpus representativo de 219 PR de 187 repositorios públicos y 19 lenguajes, según el anuncio oficial de GitHub.
Qué mide ReviewBench
El benchmark evalúa qué problemas detecta un revisor, cuántos avisos correctos produce y cuánto ruido genera. GitHub utiliza métricas de precisión y recall, además de variantes que permiten dar más peso a uno u otro objetivo. Cada hallazgo queda clasificado por gravedad y por categoría, incluyendo corrección, seguridad, fiabilidad, mantenibilidad y pruebas.
La base de referencia no depende de una única fuente. GitHub combina revisiones humanas, modelos avanzados y análisis estático, y después valida los hallazgos con una rúbrica uniforme. La empresa afirma que ingenieros sénior alcanzaron un 96,6% de acuerdo al etiquetar los verdaderos positivos del conjunto de referencia.
Qué puede hacer una empresa con su propio agente
ReviewBench no está limitado a Copilot. Un equipo puede registrar su propio agente, aportar una imagen de contenedor y su clave de modelo, ejecutar primero un test de 25 pull requests y después completar tres rondas sobre los 219 PR del benchmark. Los resultados pueden mantenerse privados durante la fase de ajuste y enviarse después al leaderboard.
Esto permite a una empresa comparar un sistema interno con otros revisores utilizando el mismo conjunto de pruebas, en vez de basarse únicamente en ejemplos preparados o sensaciones del equipo.
La utilidad está en medir antes de desplegar
Para una pyme tecnológica, el punto práctico es separar calidad de marketing. Un agente que encuentra más incidencias no necesariamente es mejor si genera demasiados falsos positivos. Antes de automatizar revisiones en repositorios críticos conviene decidir qué pesa más: detectar vulnerabilidades, reducir ruido, mejorar mantenibilidad o acelerar el merge.
GitHub publica el dataset y la metodología para que las pruebas sean reproducibles. La empresa debería usar resultados propios, con lenguajes y repositorios parecidos a los de producción, antes de convertir una puntuación general en criterio de compra.
Para situar el cambio en contexto, BlackHold News ha publicado también la nueva memoria de agentes con AlloyDB y Memorystore, las colas nativas de Spanner, la Web Search API de Cloudflare, la retirada de modelos antiguos de GitHub Copilot, el parche de SageMaker por CVE-2026-104019 y el nuevo cifrado del lado del cliente en Google Workspace.
Fotografía: Jakub Zerdzicki / Pexels.

