Google Cloud publicó el 25 de septiembre de 2026 una guía práctica para su servicio gestionado de Reinforcement Learning Fine-Tuning (RLFT) de Gemini. La propuesta permite adaptar un modelo mediante una función de recompensa definida por la empresa: el cliente aporta los prompts y la lógica que puntúa las respuestas, mientras Google gestiona la infraestructura de entrenamiento y los componentes internos del modelo. La explicación técnica está disponible en el Google Cloud Blog.
Qué cambia frente al fine-tuning supervisado
El ajuste supervisado tradicional necesita ejemplos de respuesta que el modelo debe imitar. RLFT funciona de forma distinta: genera varias respuestas, las puntúa con la función de recompensa y refuerza aquellas que alcanzan mejor el objetivo. Google lo plantea para tareas en las que es difícil redactar manualmente la respuesta ideal pero resulta relativamente sencillo comprobar si el resultado es correcto.
Un ejemplo claro es SQL. Una empresa no necesita escribir una consulta perfecta para cada esquema si puede ejecutar la salida y verificar si compila, se ejecuta y devuelve el resultado esperado. La misma lógica puede aplicarse a extracción estructurada de documentos, moderación o generación de código.
Google recomienda agotar primero prompting y SFT
La propia compañía advierte de que RLFT no es el primer paso para cualquier proyecto. Prompting y supervised fine-tuning cubren la mayoría de los casos y deberían probarse antes. RLFT gana valor cuando existe una métrica verificable, cuando SFT se ha estancado o cuando hay muchas respuestas válidas y un único ejemplo de referencia penalizaría soluciones correctas.
Además, el método no enseña desde cero una capacidad que el modelo nunca muestra. Google lo describe como una forma de convertir éxitos ocasionales en un comportamiento más fiable, no como un sustituto universal del entrenamiento o de una arquitectura bien diseñada.
La función de recompensa es el elemento crítico
Google señala que la parte que más determina la calidad final es la función de recompensa. Debe correlacionar con la preferencia humana o con el resultado empresarial, tolerar respuestas mal formadas sin romper el proceso y ser resistente a estrategias que maximicen la puntuación sin resolver realmente la tarea.
La recomendación es validar esa función fuera del entrenamiento antes de escalar. Para procesos empresariales, eso significa definir qué se considera éxito con criterios observables: campos correctamente extraídos, consultas que se ejecutan, cumplimiento de reglas o resultados que superan una prueba automática.
Qué necesita una empresa para empezar
Google propone comenzar con un conjunto diverso de prompts y separar estrictamente entrenamiento y validación. Después se define la función de recompensa, se ejecuta una primera prueba y se siguen las curvas de recompensa y evaluación. La compañía aconseja conservar el checkpoint donde la validación se estabiliza, no necesariamente el último entrenamiento realizado.
Para una pyme, RLFT tiene sentido cuando ya existe un caso de uso repetitivo con una forma clara de medir calidad. Antes de asumir el coste de personalizar un modelo conviene cuantificar el error actual, el volumen de tareas y cuánto ahorro o mejora produciría reducir ese error.
La novedad se suma a otros cambios recientes de Google Cloud y Gemini que las empresas pueden seguir en BlackHold News: el PostgreSQL para agentes de AlloyDB, Storage Intelligence, las capacidades agénticas de Gemini en Workspace, los notebooks de Gemini en Docs, Google Vids con Gemini y los informes de Google Ads asistidos por IA.
Fotografía: Christina Morillo / Pexels.

