AWS ha presentado Strands Decider 2B, un modelo pequeño y de código abierto orientado a decisiones rápidas dentro de sistemas agénticos. La compañía lo describe como una opción de razonamiento tipo “system-one”, pensada para tareas donde no compensa utilizar un modelo grande y costoso. El lanzamiento aparece en el resumen oficial de AWS del 5 de octubre.
No todas las decisiones de un agente necesitan un modelo grande
Un agente puede necesitar clasificar una solicitud, elegir una herramienta, decidir una ruta o comprobar una condición antes de invocar un modelo más potente. Utilizar el modelo principal para cada paso aumenta latencia y coste, especialmente en procesos con muchas iteraciones.
Un modelo de 2B parámetros puede cubrir decisiones sencillas si su precisión es suficiente. El ahorro real depende del volumen de llamadas y de cuánto trabajo pueda desviarse sin aumentar errores.
El formato abierto facilita pruebas locales
AWS posiciona Strands Decider para experimentación y desarrollo local. Esto permite evaluar el comportamiento cerca de la aplicación y reducir dependencia de llamadas remotas en determinadas decisiones.
Para una empresa, la cuestión es identificar tareas binarias o de clasificación donde el resultado pueda comprobarse fácilmente. No debería utilizarse por defecto para problemas que requieren contexto largo, razonamiento complejo o consecuencias económicas relevantes.
Cómo evaluar si compensa
El equipo puede registrar decisiones reales durante una semana, crear un conjunto de prueba y comparar el modelo pequeño con el modelo que utiliza actualmente. Debe medirse precisión, latencia, coste y porcentaje de casos que tienen que escalarse a un modelo mayor.
Una arquitectura escalonada puede ser más eficiente: el modelo ligero resuelve casos simples y deriva los dudosos. Sin embargo, añadir otra capa también implica mantenimiento, monitorización y versiones, por lo que el ahorro debe ser material para justificarla.
Estas novedades se suman a otros cambios recientes para equipos técnicos: Spanner con colas nativas, memoria para agentes con AlloyDB, Web Search API de Cloudflare, el parche de SageMaker, los cambios de modelos en GitHub Copilot y el cifrado del lado del cliente de Workspace.
Fotografía: Google DeepMind / Pexels.

