Recientemente he añadido la posibilidad de seleccionar un modelo de IA en Gladys, y me gustaría tener vuestra opinión al respecto: ¿qué modelo consideráis más inteligente para un uso domótico (comprensión de las consultas, relevancia de las respuestas, etc.)?
No dudéis en probar varios modelos y votar por los que prefiráis (máximo 3 opciones). Vuestros comentarios me ayudarán a saber cuáles destacar por defecto en Gladys.
Lo probé en Auto, pero no sé cuál se toma: ¿el más barato? ¿el más rápido?
Los resultados no eran buenos para la misma pregunta, incluso cambiando con los tres primeros:
Pero justo tengo comentarios de que en algunos casos no es tan inteligente, seguramente se vuelve un poco tonto a medida que aumenta el contexto. Estoy buscando un nuevo modelo por defecto
Por mi parte, he realizado varias pruebas reales en mi instalación actual que incluye: luces, persianas, enchufes, interruptores, cámaras. El que mejor se desempeña es Qwen 3.6 35B (60% de éxito frente al 10% de Mistral), pero está lejos de ser perfecto en comparación con Alexa+ o Google, que entienden más del 95% ¡Pero esto es solo mi opinión y no compromete a nadie más!
De momento no, pero si hay que elegir un modelo, mejor elegir un modelo francés.
Uso Mistral a diario y estoy satisfecho con los resultados.
Para los demás, aparte de Llama y Gemma, no los conozco.
Vale, porque Mistral 3.2 Small es bastante limitado y @Chris75, que hace muchas pruebas y usa mucho la IA en Gladys, se queja.
En cuanto al francés, en cualquier caso estos modelos son Open-Weight y están alojados en Francia en Scaleway, por lo que da igual que el modelo sea francés o no, son modelos « gratuitos », solo pago los GPU. Lo importante es realmente la calidad del resultado
@Tlse-vins ¿por qué no te unes a Gladys Plus y pruebas?
Estoy interesado en tu archivo de depuración para analizar los diferentes tests que has realizado. Puedes descargarlo de un clic desde la integración Inteligencia Artificial:
Por cierto, acabo de modificar el modo Auto para que ahora utilice Qwen 3.6 por defecto. Lo encuentro mucho más potente que Mistral Small 3.2, que empezaba a mostrar sus límites en ciertas solicitudes.
Por mi parte, también encuentro que qwen3.5-397b-a17b es excelente. Es uno de los modelos más caros de la lista, pero la calidad de las respuestas es realmente satisfactoria. Habrá que ver, con el uso, cómo se compara con Qwen 3.6.
Y, por supuesto, si Scaleway añade nuevos modelos, los integraré en la lista para que podamos probarlos todos. (La lista completa: Tarifs solutions d'Inférence d'IA | Scaleway )
Pequeña prueba que vale lo que vale (un solo caso, no un estudio científico ) pero que me ayudó a entender bien las diferencias entre los modelos.
¿Por qué probar con una escena en particular? Porque es claramente lo que más me frena en el uso diario. Un comando simple (« encender la cocina »), cualquier modelo puede manejarlo. Pero una escena, a menudo es más compleja y más larga de describir, por lo que es más revelador de si el modelo realmente razona o solo está fingiendo.
Le pedí: « crea una escena que apague el plafonnier de la cocina automáticamente 30 segundos después de haber sido encendido », sin dar el nombre exacto del dispositivo en el prompt (el nombre real es Plafonniers 3 ampoules, habitación Cocina). Y eso fue intencional, porque en la vida real, mi pareja, por ejemplo, no conoce el nombre técnico de los dispositivos, solo describe lo que hacen o dónde están (« el plafonnier de la cocina », « la lámpara al lado del sofá »…). Un asistente que necesita el nombre exacto para funcionar, no es utilizable para ella.
Prueba de choque por modelo:
Mistral Small y Holo2-30B: muertos en combate directo, la API se estrelló en cada intento. Nada que sacar de ahí.
Gemma 4 y Gemma 3-27B: intentan llamar a scene_create, pero inventan cosas (device_feature falso, icono que no existe) → boom, error 422. Gemma 3-27B tuvo el buen reflejo de verificar el estado antes (device_get_state), pero falló al final con el nombre.
Qwen3.6: error en la creación, luego la API terminó por estrellarse también.
Pixtral 12B: el peor en modo « hago como si ». Te saca el JSON en bucle diciendo « lo voy a ejecutar ahora » pero nunca llama realmente a la herramienta, incluso cuando le dices « adelante », « llama a la función » tres veces seguidas.
Llama 3.3-70B: buenos reflejos en la lógica (retardo + apagado), pero device_feature e icono inválidos → 422 directo.
Qwen3-235B: el más astuto del grupo. Te anuncia « la escena ha sido creada con éxito » cuando no ha llamado a ninguna herramienta. Cero llamadas a herramientas, pura alucinación de éxito. El peor caso para mí, el falso positivo silencioso que te hace creer que tienes un auto cuando no tienes nada.
Qwen 3.5 (379B): el único de los 9 que supo encontrar el dispositivo correcto por sí mismo. Primero verifica el estado de los dispositivos en la habitación Cocina (device_get_state), identifica el plafonnier correcto a partir de su descripción en lenguaje natural, y luego lanza un scene_create que pasa directo. La escena realmente existe detrás, probado y verificado.
Lo que me convenció: no es solo sacar JSON que parezca bueno, es la capacidad de encontrar el dispositivo correcto a partir de una descripción natural en lugar de exigir el nombre exacto o improvisar un ID al azar. Es exactamente el tipo de fricción que hace que siempre posponga la creación de mis escenas — si debo conocer de memoria el nombre técnico de cada dispositivo para que funcione, mejor hacerlo manualmente en la interfaz. Un asistente que entiende « el plafonnier de la cocina » sin más precisión, cambia realmente el juego para la adopción por toda la familia, no solo por mí.
¡Gracias por este análisis tan completo, me ayuda muchísimo!
Al final, tu opinión es bastante coherente con las capacidades técnicas de cada modelo. Qwen 3.5 (379B) es el modelo más grande de la selección, y en la práctica, también el más potente.
@Chris75, me encantaría conocer tu opinión sobre Qwen 3.5 (379B).
También estoy considerando añadir otros modelos, esta vez alojados en DigitalOcean en Alemania, porque la oferta de Scaleway sigue siendo bastante limitada en los modelos más potentes. Pienso especialmente en DeepSeek V4 Pro, que ofrece una excelente relación calidad-precio y está disponible en DigitalOcean.
Seguiríamos con un alojamiento en Europa, en una infraestructura de cloud privada.
¿Les parecería aceptable este compromiso?
Yo diría que sí por mi parte: Europa, RGPD (normalmente seguido por los europeos), a ver por el lado de las CGU y los alojamientos de sus servidores.
¿Has comprobado con nuestros camaradas suizos con Proton y Infomaniak?
Por mi parte aún no lo he probado todo, sobre todo he tenido muchos fallos de la IA, te compartiré mis logs por MP. En todo caso las IA tienen problemas con mi piscina
Por cierto, ¿qué IA usas para el resumen semanal? porque esa funciona muy bien (siempre en relación con mi consumo y costo de la piscina).
bueno, he realizado muchas pruebas con Qwen 3.5 397B a17b para usos cotidianos (luces, persianas, interruptores, estado/historial de los sensores, consumo de enchufes, consumo de EDF, cámaras) y efectivamente los resultados son mejores que con qwen 3.6 35b.
No he probado la creación de escenas
Problemas principales detectados: la IA no sabe ajustar la luminosidad/color de las luces (eso es una gran carencia), descifrado de historiales a veces no encontrados, clima no encontrado, estado de las pilas no encontrado, …
Acabo de cambiar el modo Auto a Qwen 3.5 397B A17B. Así, ya sea en el chat o en voz, las respuestas deberían ser más pertinentes. Voy a vigilar los costos para ver si es viable usarlo como modelo predeterminado.
Por otro lado, para el resumen semanal, me quedo con Mistral Small 3.2. Con Qwen 3.5, el prompt se vuelve tan voluminoso que el modelo tarda más de 2 minutos en responder, y al final no obtengo mejores resultados que Mistral según mis pruebas.
PREGUNTA: « ¿Cuál fue el consumo en kWh del enchufe del inversor para el día 12 de julio de 2026? »
RESPUESTA: Según los datos del Enchufe del Inversor, veo el historial de consumo acumulado en kWh. Sin embargo, los datos devueltos están truncados y no puedo ver los valores exactos en los límites del 12 de julio de 2026 (medianoche del 12 y medianoche del 13).
Lo que puedo observar:
El 10 de julio alrededor de las 12:30: 48,99 kWh (acumulado)
El 11 de julio alrededor de las 23:45: aproximadamente 50,08 kWh (acumulado)
Para obtener el consumo exacto del 12 de julio, sería necesario restar el valor acumulado al final del día 11 del valor acumulado al final del día 12. Desafortunadamente, los datos precisos para este período no son completamente visibles en el resultado.
¿Desea que verifique los datos de otra manera o para un período diferente?
¡Buenas noticias! La IA de Gladys va a volverse mucho más rápida, y de paso, más relevante.
El problema
Con cada nueva funcionalidad, añadimos herramientas que la IA puede usar (encender una luz, leer una temperatura, crear una escena…). Excepto que todas estas herramientas se envían al modelo con cada mensaje. Resultado: el prompt se vuelve más pesado, y incluso un simple «enciende la luz del salón» se convierte en una solicitud compleja de analizar. Es un fenómeno conocido: cuanto más herramientas disponibles hay, más se degrada la precisión de selección, sin importar el modelo utilizado.
La solución: un enrutamiento en dos pasos
En lugar de una sola llamada grande, hacemos dos:
Clasificación: un modelo ligero y rápido recibe únicamente la lista de herramientas y determina el tipo de solicitud.
Ejecución: la verdadera solicitud parte con solo las herramientas útiles. La herramienta más pesada, scene.create, solo se carga si la solicitud ha sido clasificada como una creación de escena.
Este paso de clasificación aporta un segundo beneficio: permite desactivar el modo «reflexión» del modelo en las solicitudes simples, donde a menudo añadía varios segundos sin razón. La creación de escenas, sin embargo, mantiene este modo de razonamiento porque realmente lo necesita para seguir siendo fiable.
En concreto para ustedes
En un comando común (luz, temperatura, persiana…), pasamos de 10 a 15 segundos en los peores casos a solo unos segundos. La parte de IA de la cadena incluso baja de un segundo.
¡Esto estará disponible en la próxima versión de Gladys!