J’ai récemment ajouté la possibilité de sélectionner un modèle d’IA dans Gladys, et j’aimerais avoir votre retour sur le sujet : quel modèle trouvez-vous le plus intelligent pour un usage domotique (compréhension des requêtes, pertinence des réponses, etc.) ?
Si vous n’utilisez pas Gladys Plus, il y a un mois gratuit sans CB, donc n’hésitez pas, c’est fait pour
N’hésitez pas à tester plusieurs modèles et à voter pour ceux que vous préférez (3 choix max). Vos retours m’aideront à savoir lesquels mettre en avant par défaut dans Gladys !
J’ai testé en Auto mais on ne sait pas lequel est pris : le moins cher ? le plus rapide ?
Les résultats n’étaient pas terrible pour la même question donnée, même en changeant avec les 3 premiers :
Mais justement, j’ai des retours comme quoi chez certain il n’est pas si intelligent que ça, sûrement qu’il devient un peu bête plus le contexte augmente. Je cherche un nouveau modèle par défaut
De mon côté j’ai fait plusieurs tests réels sur mon installation actuelle qui comprend : des lumières, des volets, des prises, des interrupteurs, des caméras, celui qui s’en sort le mieux c’est Qwen 3.6 35B (60% de réussite contre 10% pour mistral), mais c’est loin d’être parfait par rapport à Alexa+ ou Google qui comprennent plus de 95% ! Mais ceci n’est que mon avis et n’engage que moi !
Pour le moment non, mais à choisir un modèle autant choisir un modèle Français.
J’utilise Mistral au quotidien et je suis satisfait des résultats.
Pour les autres à part Llama et Gemma, je ne les connais pas.
Ok, parce que pour le coup Mistral 3.2 Small est assez limité et @Chris75 qui fait beaucoup de tests et utilise beaucoup l’IA dans Gladys, s’en plaint.
Pour le côté français, dans tous les cas ces modèles sont Open-Weight, et hébergés en France chez Scaleway, donc peu importe que le modèle soit français ou pas, ce sont des modèles « gratuit », je ne paie que les GPU. L’important c’est vraiment la qualité du résultat
@Tlse-vins pourquoi ne pas rejoindre Gladys Plus et tester ?
Je suis preneur de ton fichier de debug pour analyser les différents tests que tu as effectués. Tu peux le télécharger en un clic depuis l’intégration Intelligence Artificielle :
Au passage, je viens de modifier le mode Auto pour qu’il utilise désormais Qwen 3.6 par défaut. Je le trouve nettement plus performant que Mistral Small 3.2, qui commençait à montrer ses limites sur certaines demandes.
De mon côté, je trouve aussi que qwen3.5-397b-a17b est excellent. C’est l’un des modèles les plus coûteux de la liste, mais la qualité des réponses est vraiment au rendez-vous. Il faudra voir, à l’usage, comment il se compare à Qwen 3.6.
Et bien sûr, si Scaleway ajoute de nouveaux modèles, je les intégrerai à la liste pour qu’on puisse tous les tester ! (La liste complète: Tarifs solutions d'Inférence d'IA | Scaleway )
Petit test qui vaut ce qu’il vaut (un seul cas, pas une étude scientifique ) mais qui m’a bien éclairé sur les différences entre modèles.
Pourquoi tester sur une scène précisément ? Parce que c’est clairement ce qui me freine le plus dans l’usage au quotidien. Une commande simple (« allume la cuisine »), n’importe quel modèle s’en sort. Mais une scène, c’est souvent plus complexe et plus long à décrire, donc plus révélateur de si le modèle raisonne vraiment ou s’il bluffe.
J’ai demandé : « crée une scène qui éteint le plafonnier de la cuisine automatiquement 30 secondes après qu’elle ait été allumée », sans donner le nom exact du device dans le prompt (le vrai nom c’est Plafonniers 3 ampoules, pièce Cuisine). Et ça c’était fait exprès, parce que dans la vraie vie, ma compagne par exemple, elle connaît pas le petit nom technique des devices, elle décrit juste ce qu’ils font ou où ils sont (« le plafonnier de la cuisine », « la lampe à côté du canapé »…). Un assistant qui a besoin du nom pile poil pour fonctionner, c’est pas utilisable pour elle.
Le crash test par modèle :
Mistral Small et Holo2-30B : mort au combat direct, l’API a crashé à chaque tentative. Rien à en tirer.
Gemma 4 et Gemma 3-27B : ils tentent bien d’appeler scene_create, mais ils inventent des trucs (device_feature bidon, icône qui existe pas) → boom, erreur 422. Gemma 3-27B a quand même eu le bon réflexe de check l’état avant (device_get_state), mais s’est planté à l’arrivée sur le nommage.
Qwen3.6 : erreur à la création, puis l’API a fini par crasher aussi.
Pixtral 12B : le pire en mode « je fais style ». Il te ressort le JSON en boucle en disant « je vais l’exécuter maintenant » mais n’appelle jamais réellement l’outil, même quand tu lui dis « vas-y », « appelle la fonction » 3 fois de suite.
Llama 3.3-70B : bons réflexes sur la logique (delay + turn-off), mais device_feature et icône invalides → 422 direct.
Qwen3-235B : le plus vicieux du lot. Il t’annonce « la scène a été créée avec succès » alors qu’il n’a appelé aucun outil. Zéro tool call, pure hallucination de succès. Le pire cas pour moi, le faux positif silencieux qui te fait croire que t’as une auto alors que t’as rien.
Qwen 3.5 (379B) : le seul des 9 qui a su retrouver le bon appareil tout seul. Il check d’abord l’état des devices dans la pièce Cuisine (device_get_state), identifie le bon plafonnier à partir de sa description en langage naturel, puis balance un scene_create qui passe direct. La scène existe vraiment derrière, testé et vérifié.
Ce qui m’a convaincu : c’est pas juste sortir du JSON qui a l’air bon, c’est la capacité à retrouver le bon device à partir d’une description naturelle plutôt que d’exiger le nom exact ou d’improviser un ID au pif. C’est exactement le genre de friction qui fait que je repousse toujours la création de mes scènes — si je dois connaître par cœur le nom technique de chaque appareil pour que ça marche, autant le faire à la main dans l’interface. Un assistant qui comprend « le plafonnier de la cuisine » sans plus de précision, ça change vraiment la donne pour l’adoption par toute la famille, pas que par moi.
Merci pour cette analyse très complète, elle m’aide énormément !
Au final, ton retour est assez cohérent avec les capacités techniques de chaque modèle. Qwen 3.5 (379B) est le plus gros modèle de la sélection, et c’est aussi, en pratique, le plus performant.
@Chris75, je serais curieux d’avoir ton retour sur Qwen 3.5 (379B) !
J’hésite aussi à ajouter d’autres modèles, cette fois hébergés chez DigitalOcean en Allemagne, car l’offre de Scaleway est encore assez limitée sur les modèles les plus puissants. Je pense notamment à DeepSeek V4 Pro, qui offre un excellent rapport qualité/prix et est disponible chez DigitalOcean.
On resterait sur un hébergement en Europe, sur une infrastructure cloud privée.
Est-ce que ce compromis vous semblerait acceptable ?
Je dirais oui pour ma part : Europe, RGPD (normalement suivi par les européens), à voir côté CGU et les hébergements de leurs serveurs.
Tu as checké du côté de nos camarades suisses avec Proton et Infomaniak ?
De mon côté je n’ai pas encore tout testé, j’ai surtout eu plein de plantage de l’IA, je te partagerai en MP mes logs. En tout cas les IA ont du mal avec ma piscine
Sinon tu utilises quelle IA pour le résumé hebdo ? car celui-là fonctionne très bien (toujours par rapport à ma conso et coût piscine).
bon j’ai fait beaucoup des tests avec Qwen 3.5 397B a17b pour des usages quotidiens (lumière, volet roulant, interrupteur, état/historique des capteur , consommation prises, conso edf, caméras et effectivement les résultats sont meilleurs qu’avec qwen 3.6 35b.
Je n’ai pas testé la création de scènes
Principaux problèmes relevés : l’IA ne sait pas régler la luminosité/couleur des lumières (ça c’est une grosse lacune), déchiffrement des historiques parfois non trouvés, météo non trouvée, etat des piles non trouvés, …
Merci pour tes tests @Chris75, c’est super utile !
Je viens de passer le mode Auto sur Qwen 3.5 397B A17B. Comme ça, que ce soit dans le chat ou en vocal, les réponses devraient être plus pertinentes. Je vais surveiller les coûts pour voir si c’est viable de l’utiliser comme modèle par défaut.
En revanche, pour le digest hebdomadaire, je reste sur Mistral Small 3.2. Avec Qwen 3.5, le prompt devient tellement volumineux que le modèle met plus de 2 minutes à répondre, et au final je n’obtiens pas de meilleur résultat que Mistral d’après mes tests.
QUESTION : « quelle a été la consommation en Kwh de la prise onduleur pour la journée du 12 juillet 2026 »
REPONSE : D’après les données de la Prise Onduleur, je vois l’historique de consommation cumulative en kWh. Cependant, les données retournées sont tronquées et je ne peux pas voir les valeurs exactes aux boundaries du 12 juillet 2026 (minuit le 12 et minuit le 13).
Ce que je peux observer :
Le 10 juillet vers 12h30 : 48,99 kWh (cumul)
Le 11 juillet vers 23h45 : environ 50,08 kWh (cumul)
Pour obtenir la consommation exacte du 12 juillet, il faudrait soustraire la valeur cumulative de fin de journée du 11 juillet de celle de fin de journée du 12 juillet. Malheureusement, les données précises pour cette période ne sont pas entièrement visibles dans le résultat.
Souhaitez-vous que je vérifie les données d’une autre manière ou pour une période différente ?
Bonne nouvelle : l’IA de Gladys va devenir beaucoup plus rapide, et au passage plus pertinente.
Le problème
À chaque nouvelle fonctionnalité, on ajoute des outils que l’IA peut utiliser (allumer une lumière, lire une température, créer une scène…). Sauf que tous ces outils sont envoyés au modèle à chaque message. Résultat : le prompt s’alourdit, et même un simple « allume la lumière du salon » devient une requête complexe à analyser. C’est un phénomène connu : plus il y a d’outils disponibles, plus la précision de sélection se dégrade, quel que soit le modèle utilisé.
La solution : un routage en deux étapes
Au lieu d’un seul gros appel, on en fait deux :
Classification : un modèle léger et rapide reçoit uniquement la liste des outils et détermine le type de demande.
Exécution : la vraie requête part avec seulement les outils utiles. L’outil le plus lourd, scene.create, n’est chargé que si la demande a été classifiée comme une création de scène.
Cette étape de classification apporte un deuxième gain : elle permet de désactiver le mode « réflexion » du modèle sur les requêtes simples, là où il ajoutait souvent plusieurs secondes pour rien. La création de scènes, elle, garde ce mode de raisonnement parce qu’elle en a réellement besoin pour rester fiable.
Concrètement pour vous
Sur une commande courante (lumière, température, volet…), on passe de 10 à 15 secondes dans les pires cas à quelques secondes seulement. La partie IA de la chaîne descend même sous la seconde.
Ce sera disponible dans la prochaine version de Gladys !