El fenómeno conocido como el «bucle de la muerte» es uno de los problemas más persistentes y molestos en el uso de modelos de lenguaje. Se produce cuando la IA entra en un ciclo de repetición infinita, algo que resulta especialmente crítico durante flujos de trabajo agénticos, como el desarrollo de código.
¿Qué modelos están en riesgo?
Aunque cualquier modelo puede sufrirlo, este problema afecta principalmente a los modelos que comparten cuatro características clave:
- Son pequeños
- Están diseñados para el razonamiento
- Operan con baja temperatura
- Se utilizan con contextos muy largas
Estas características encajan sobre todo con los modelos locales, que son los que más se ven afectados por estos bucles
Las 3 causas principales del bucle de la muerte
Según investigaciones recientes de Liquid AI, existen tres factores fundamentales que desencadenan estas repeticiones:
- Palabras sobreentrenadas: Los modelos tienden a recurrir a «muletillas» (palabras o frases que usa con mayor frecuencia de la que debería) cuando no tienen claro cómo continuar. Si el estado de duda persiste, la probabilidad de elegir esa misma palabra aumenta, iniciando el bucle.
- Refuerzo de frases existentes: Cuando una frase ya aparece en el texto, las probabilidades de que el modelo la repita crecen, con cada uso esta posibilidad sigue creciendo.
- Baja temperatura: Para razonar correctamente, muchos modelos operan a temperaturas muy bajas o cercanas a cero. Esto reduce la variedad de las respuestas y hace que el modelo elija siempre el token más probable, volviéndose determinista y propenso a repetir las mismas frases.
El desafío de las soluciones actuales
Actualmente, se suele utilizar una penalización por repetición, la cual baja la probabilidad de una palabra si ya ha aparecido recientemente. Sin embargo, esta técnica requiere un equilibrio muy difícil: si la penalización es muy alta, el modelo puede fallar al escribir código (donde es necesario repetir palabras habitualmente); si es muy baja, no lograra romper el bucle.
La propuesta de Liquid AI: FTPO
Liquid AI ha presentado una técnica innovadora llamada Final Token Preference Optimization (FTPO). Su enfoque consiste en un ajuste fino (fine-tuning) muy específico:
- Se fuerza al modelo a entrar en bucle repetidamente para recolectar datos.
- Se identifica el primer token que origina cada bucle.
- Se reentrena el modelo para aumentar las probabilidades de las alternativas que tenía en ese momento inicial.
Este proceso es iterativo, ya que al solucionar un bucle suelen aparecer otros nuevos causados por tokens distintos.
Resultados prometedores
Los resultados son contundentes: al aplicar FTPO en modelos como Qwen 3.5, se ha logrado reducir la tasa de bucles de la muerte de un 10-22% a tan solo un 1% aproximadamente. Además de mejorar la fluidez, esta técnica permite que los modelos superen mejor ciertos benchmarks en los que antes fallaban por quedarse bloqueados en repeticiones.
Este avance representa un paso fundamental para hacer que los modelos locales sean herramientas verdaderamente fiables en tareas complejas y autónomas.