Google Cloud publicó el 2 de octubre de 2026 una arquitectura de memoria de dos niveles para agentes de inteligencia artificial que combina Memorystore for Valkey para contexto reciente y AlloyDB AI para recuerdos duraderos. La compañía afirma que este patrón puede reducir hasta un 70% el gasto en tokens al evitar reenviar historiales completos al modelo en cada interacción, según su publicación técnica oficial.
Cómo funciona la memoria en dos niveles
El primer nivel conserva el contexto de corto plazo que necesita una conversación activa: mensajes recientes, estado de una tarea o datos que cambian con rapidez. Ese contenido se mantiene en Memorystore, diseñado para accesos de baja latencia. El segundo nivel utiliza AlloyDB AI para almacenar información más estable que puede recuperarse por relevancia cuando el agente vuelve a necesitarla.
En lugar de enviar todo el historial al modelo, la aplicación recupera solo los fragmentos que aportan contexto a la petición actual. Esa selección es la que puede reducir el número de tokens procesados y, con ello, parte del coste y la latencia.
Qué empresas pueden beneficiarse
El patrón resulta especialmente útil en asistentes de soporte, agentes comerciales, herramientas internas y aplicaciones que mantienen conversaciones durante días o semanas. Un agente puede recordar preferencias, decisiones previas o datos de un cliente sin incluir todas las interacciones anteriores en cada prompt.
La cifra del 70% es un máximo comunicado por Google y no debe trasladarse directamente a cualquier proyecto. El ahorro real dependerá del tamaño del historial, del modelo, de la frecuencia de recuperación y de la calidad del sistema que decide qué recuerdos conservar.
Privacidad y gobernanza pasan a ser críticas
Persistir memoria también aumenta la responsabilidad de la empresa. Hay que definir qué información puede almacenarse, durante cuánto tiempo, quién puede recuperarla y cómo se elimina cuando deja de ser necesaria. Un sistema que recuerda datos personales o secretos comerciales necesita controles de acceso y trazabilidad equivalentes a cualquier otra base de datos empresarial.
Qué debería medir una pyme
Antes de desplegar el patrón a gran escala conviene comparar coste por conversación, tokens enviados, latencia y calidad de respuesta con y sin memoria. También debe comprobarse si el agente recupera información correcta y actualizada o si empieza a reutilizar contexto obsoleto.
Para situar el cambio dentro de la operación tecnológica de una empresa, conviene revisar también la actualización de GitHub CodeQL, el parche crítico de GitLab, la adopción de passkeys en Microsoft Entra, la remediación automática de Cloudflare CASB, las capacidades agénticas de Google Workspace y los roles temporales de administrador de Workspace.
Fotografía: panumas nikhomkhai / Pexels.

