Google Cloud ha llevado a disponibilidad general GKE Agent Sandbox optimizado para reinforcement learning y evaluación masiva de agentes. La compañía asegura que la nueva infraestructura puede reducir los tiempos de arranque de los entornos aislados hasta 45 veces frente a configuraciones convencionales, evitando que costosos clústeres GPU permanezcan esperando a que se preparen sandboxes CPU, según el anuncio oficial publicado el 29 de septiembre.
El cuello de botella está en preparar miles de entornos aislados
El entrenamiento y evaluación de agentes de código puede requerir ejecutar miles de tareas en paralelo, cada una dentro de un entorno separado. Google explica que descargar imágenes grandes, crear pods y preparar sandboxes puede consumir minutos y dejar GPU infrautilizadas mientras esperan resultados.
GKE Agent Sandbox intenta reducir ese tiempo mediante un runtime optimizado y una arquitectura que reutiliza capas comunes sin eliminar el aislamiento necesario entre ejecuciones.
Google añade un SDK específico para orquestar reinforcement learning
Junto al runtime, Google lanza Agent Sandbox RL orchestration SDK, pensado para coordinar grandes cantidades de entornos durante entrenamiento y evaluación. También incorpora integraciones nativas con herramientas y harnesses utilizados en investigación de reinforcement learning agéntico.
Para una empresa que desarrolla agentes propios, el objetivo es poder aumentar el número de pruebas concurrentes sin construir desde cero toda la capa de creación, reciclado y monitorización de sandboxes.
El aislamiento sigue siendo parte central del diseño
Los agentes que ejecutan código generado o navegan por repositorios necesitan límites claros. Un fallo en una tarea no debería permitir acceder al entorno de otra ni al clúster subyacente. Google presenta GKE Agent Sandbox como una forma de combinar ese aislamiento con tiempos de arranque mucho más bajos.
Esto resulta especialmente relevante en evaluación de código, herramientas internas y pipelines donde el agente puede ejecutar comandos no deterministas o paquetes que no han sido revisados previamente.
Qué debería valorar una empresa antes de adoptarlo
Una pyme o equipo de IA debería medir primero cuántas ejecuciones concurrentes necesita, cuánto tiempo pasa esperando infraestructura y cuál es el coste de mantener GPU o nodos infrautilizados. Si el volumen es pequeño, el beneficio puede ser limitado; a gran escala, el tiempo de arranque sí puede convertirse en un coste importante.
La novedad se suma a otras capacidades empresariales recientes: nuevos agentes de seguridad en Gemini Enterprise, ajuste de Gemini con RLFT, instancias X5 de hasta 48 TB, capacidades agénticas en Workspace, roles temporales de administrador y Google Vids con Gemini.
Fotografía: panumas nikhomkhai / Pexels.

