La familia de modelos Qwen 3.6 ha resultado ser de los mejores modelos en cuanto a «inteligencia» / tamaño. Hay modelos más pequeños o más inteligentes, pero no con un equilibrio tan bueno.
Además permiten múltiples configuracione para diversas tareas, no es que vayas a ver u, gran cambio entre ellos, pero si que, en algunos casos, se puede notar una mejora en cierto tipo de tareas.
Voy a centrarme en los modelos Qwen 3.6 27B y Qwen 3.6 35B A3B, pero lo aquí mostrado sirve para todos los modelos de la familia.
Aunque aquí voy a usar los parámetros de Llama.cpp es fácil adaptarlo a cualquier otro motor de LLM
General
Es el caso genérico, una configuración pensada para un uso general
--temp 1.0--top-p 0.95--top-k 20 --min-p 0.00
Si entra en bucles añadir:
--presence-penalty 1.0
Coder
Es la configuración que mejor funciona para la creación de código.
--temp 0.6--top-p 0.95--top-k 20 --min-p 0.00
Si entra en bucles añadir:
--presence-penalty 1.0
Agent
Es un caso específico de la anterior configuración para su uso en tareas agenticas. Además de tener el razonamiento activado se preservan las trazas de este razonamiento en la conversación. Esto mejora su capacidad de realizar tareas de varios pasos, a cambio consume más contexto.
--temp 0.6--top-p 0.95--top-k 20 --min-p 0.00--chat-template-kwargs '{"preserve_thinking":true}'
Si entra en bucles añadir:
--presence-penalty 1.0
Fast
La configuración más rápida, sin razonamiento. Destaca por su creatividad…aunque eso no tiene por qué ser bueno en según que tareas.
A la versión 27B no le veo mucho sentido, si queremos velocidad podemos usar alguna de las configuraciones de 35B-A3 y razonamiento activado.
Si lo que quieres es aumentar su lado creativo puedes probar a ir subiendo poco a poco la temperatura.
--temp 0.7--top-p 0.8--top-k 20 --min-p 0.00 --chat-template-kwargs '{"enable_thinking":false}'
¿Con o sin MTP?
La respuesta es MTP siempre que sea posible. MTP permite estimar más de un token por iteración del modelo. Esto ocurre sin afectar a la calidad del texto generado que es el mismo token a token
Usar MTP:
--spec-type draft-mtp --spec-draft-n-max 2
El valor habitualmente recomendado es 2 pero hay gente que reporta mejores resultados con valor 3 (¡Probad!)
Bonus Plus: MTP + NGram
Una ventaja de Llama.cpp es que te permite usar múltiples estrategias para predecir el siguiente token. NGram puede resultar un buen predictor cuando hablamos de código. Combinar ambas estrategia puede ayudar a ganar un poco de velocidad.
--spec-type draft-mtp,ngram-simple--spec-draft-n-max 2
En este caso uso ngram-simple porque es la estrategia más sencilla, pero Llama.cpp cuenta con diversas variantes y múltiples parámetros de configuración
Buenos compañeros:
Es una buena opción tener un LLM alternativo para ayudar a nuestro LLM principal cuando tiene problemas con alguna tarea.
En el caso de Qwen unos buenos compañeros de viaje son los modelos Gemma 4. Yo uso Gema 4 31B como alternativa a Qwen 3.6 27B y Gemma 4 26B A4B como alternativa a Qwen 3.6 35B A3B
Por suerte, configurarlos es más sencillo, la configuratión recomendada es:
--temp 1.0--top-p 0.95--top-k 64
Y si tienes la versión MTP:
--spec-type draft-mtp--spec-draft-n-max 4
Lo miso que con Qwen, probar diferentes valores