Umfrage: Welches ist Ihr bevorzugtes KI-Modell in Gladys?

Hallo zusammen!

Ich habe kürzlich die Möglichkeit hinzugefügt, ein KI-Modell in Gladys auszuwählen, und ich würde gerne euer Feedback dazu haben: Welches Modell findet ihr am intelligentesten für den Einsatz in der Hausautomatisierung (Verständnis der Anfragen, Relevanz der Antworten usw.)?

Falls ihr Gladys Plus nicht nutzt, gibt es einen kostenlosen Monat ohne Kreditkarte, also zögert nicht, es ist dafür da :innocent:

Testet gerne mehrere Modelle und stimmt für die, die ihr am besten findet (max. 3 Auswahlmöglichkeiten). Euer Feedback hilft mir zu entscheiden, welche Modelle standardmäßig in Gladys hervorgehoben werden sollen!

  • Mistral 3.2 (€)
  • Gemma 4 (€)
  • Qwen 3.6 35B (€€)
  • Pixtral 12B (€)
  • Gemma 3 27B (€)
  • Holo2 30B (€)
  • Qwen 3.5 397B (€€€)
  • Llama 3.3 70B (€€)
  • Qwen 3 235B (€€€)
0 votant

Vielen Dank an alle, die testen werden :raising_hands:

Ich persönlich nutze sie (noch) nicht.

Ich habe es mit Auto versucht, aber man weiß nicht, welches genommen wird: das günstigste? das schnellste?
Die Ergebnisse waren für dieselbe Frage nicht gut, selbst wenn man mit den ersten drei gewechselt hat:



Danach, als ich gewechselt habe, hatte ich einen Fehler „KI nicht verfügbar“ (meine Credits waren in Ordnung).

Und wenn man die wöchentliche Zusammenfassung hat, dann habe ich die richtigen Infos (für den Pool).

Ich werde weiter testen und versuchen, etwas mehr zu dokumentieren, und nicht mehr die KI zu beschimpfen, wenn sie nichts versteht :winking_face_with_tongue:

Mistral 3.2 Small!

Aber genau das ist der Punkt, ich habe Rückmeldungen, dass es bei einigen nicht so intelligent ist, vielleicht wird es ein bisschen dumm, je mehr der Kontext zunimmt. Ich suche ein neues Standardmodell :grin:

Von meiner Seite aus habe ich mehrere echte Tests an meiner aktuellen Installation durchgeführt, die Folgendes umfasst: Lichter, Rollläden, Steckdosen, Schalter, Kameras. Am besten schneidet Qwen 3.6 35B ab (60% Erfolg gegenüber 10% für Mistral), aber das ist weit davon entfernt, perfekt zu sein im Vergleich zu Alexa+ oder Google, die über 95% verstehen! Aber das ist nur meine Meinung und bindet nur mich!

@Tlse-vins @ZoLTRoN Danke für eure Stimmen, aber soweit ich mich erinnere, nutzt ihr nicht Gladys Plus, oder?

Zum jetzigen Zeitpunkt nein, aber wenn man schon ein Modell auswählen muss, dann lieber ein französisches.
Ich verwende Mistral täglich und bin mit den Ergebnissen zufrieden.
Bei den anderen kenne ich außer Llama und Gemma keine.

Okay, weil Mistral 3.2 Small für den Anlass ziemlich eingeschränkt ist und @Chris75, der viele Tests durchführt und viel KI in Gladys nutzt, sich darüber beschwert.

Was die französische Sprache angeht, sind diese Modelle in jedem Fall Open-Weight und werden in Frankreich bei Scaleway gehostet, also ist es egal, ob das Modell französisch ist oder nicht, es sind „kostenlose“ Modelle, ich zahle nur für die GPUs. Wichtig ist wirklich die Qualität des Ergebnisses :smiley:

@Tlse-vins, warum schließt du dich nicht Gladys Plus an und testest es? :slight_smile:

Ich verwende Mistral außerhalb von Gladys und für die Diskussion habe ich nichts ausgewählt.

Hallo,

Ich wollte die Erstellung einer Szene testen:

« Erstelle eine Szene, die den RV-Konvektor von 7 bis 9 Uhr und von 21 bis 23 Uhr auf Komfortmodus und sonst auf Ökomodus setzt. »

Einmal im Automatikmodus, dann mit Qwen 3.25, 3.5 und 3.6

Der Automatikmodus (soweit ich mich erinnere, kann man das danach nicht mehr sehen) erstellt eine Szene, die dann weder von Qwen 3.25 noch von 3.6 verändert wurde.

Für mich kann die Szene nicht funktionieren:

4 programmierte Auslöser: 7 Uhr, 9 Uhr, 21 Uhr, 23 Uhr

4 aufeinanderfolgende Aktionen: 1 → Frostschutz; 2 → Eco; 3 → Frostschutz; 4 → Eco

Dann erstellt Qwen 3.6 mir 4 Szenen, um zum Ergebnis zu kommen!

Ich hatte es auf meiner Seite in zwei Szenen gemacht und die Idee war, es in einer Szene zu machen. Also war ich vom Ergebnis überrascht!!!..

(ps: absoluter Anfänger in Sachen KI :wink: )

Danke für dein Feedback @Herve :grinning_face_with_smiling_eyes:

Ich wäre an deiner Debug-Datei interessiert, um die verschiedenen Tests zu analysieren, die du durchgeführt hast. Du kannst sie mit einem Klick aus der Künstliche-Intelligenz-Integration herunterladen:

Du kannst sie mir dann privat zuschicken.

Übrigens habe ich gerade den Auto-Modus geändert, damit er jetzt standardmäßig Qwen 3.6 verwendet. Ich finde ihn deutlich leistungsfähiger als Mistral Small 3.2, der bei einigen Anfragen langsam seine Grenzen zeigte.

Von meiner Seite finde ich auch, dass qwen3.5-397b-a17b ausgezeichnet ist. Es ist eines der teuersten Modelle der Liste, aber die Qualität der Antworten ist wirklich beeindruckend. Wir werden sehen müssen, wie es sich im Gebrauch im Vergleich zu Qwen 3.6 schlägt. :slightly_smiling_face:

Und natürlich, wenn Scaleway neue Modelle hinzufügt, werde ich sie der Liste hinzufügen, damit wir alle sie testen können! (Die vollständige Liste: Tarifs solutions d'Inférence d'IA | Scaleway )

Warum ich für Qwen 3.5 (379B) gestimmt habe

Ein kleiner Test, der das wert ist, was er wert ist (ein einzelner Fall, keine wissenschaftliche Studie :sweat_smile:), der mir aber die Unterschiede zwischen den Modellen gut aufgezeigt hat.

Warum genau eine Szene testen? Weil das genau das ist, was mich im Alltag am meisten bremst. Ein einfacher Befehl (« Küche an »), damit kommt jedes Modell klar. Aber eine Szene ist oft komplexer und länger zu beschreiben, daher aufschlussreicher, ob das Modell wirklich nachdenkt oder nur blufft.

Ich habe gefragt: « Erstelle eine Szene, die das Küchen-Deckenlicht automatisch 30 Sekunden nach dem Einschalten ausschaltet », ohne den genauen Namen des Geräts im Prompt anzugeben (der echte Name ist Plafonniers 3 Ampullen, Raum Küche). Und das war Absicht, denn im echten Leben kennt meine Partnerin zum Beispiel nicht die technischen Spitznamen der Geräte, sie beschreibt einfach, was sie tun oder wo sie sind (« das Küchen-Deckenlicht », « die Lampe neben dem Sofa »…). Ein Assistent, der den exakten Namen braucht, um zu funktionieren, ist für sie nicht nutzbar.

Der Crash-Test pro Modell:

  • Mistral Small und Holo2-30B: direkt im Kampf gefallen, die API ist bei jedem Versuch abgestürzt. Nichts zu holen.
  • Gemma 4 und Gemma 3-27B: Sie versuchen, scene_create aufzurufen, aber sie erfinden Dinge (falsche device_feature, nicht existierende Icons) → Boom, Fehler 422. Gemma 3-27B hatte immerhin den richtigen Reflex, den Zustand vorher zu prüfen (device_get_state), ist aber am Ende am Namen gescheitert.
  • Qwen3.6: Fehler bei der Erstellung, dann ist auch die API abgestürzt.
  • Pixtral 12B: Das Schlimmste im Modus « Ich tu nur so ». Er spuckt das JSON in einer Schleife aus und sagt « Jetzt führe ich es aus », ruft aber nie wirklich das Tool auf, selbst wenn du ihm dreimal hintereinander sagst « Los », « Ruf die Funktion auf ».
  • Llama 3.3-70B: Gute Reflexe bei der Logik (Verzögerung + Ausschalten), aber ungültige device_feature und Icons → 422 direkt.
  • Qwen3-235B: Der hinterhältigste von allen. Er verkündet « Die Szene wurde erfolgreich erstellt », obwohl er kein Tool aufgerufen hat. Kein Tool-Aufruf, reine Halluzination von Erfolg. Das Schlimmste für mich, der stille falsche Positivfall, der dich glauben lässt, du hättest ein Auto, obwohl du nichts hast.
  • Qwen 3.5 (379B): Das einzige der neun, das das richtige Gerät allein finden konnte. Er prüft zuerst den Zustand der Geräte im Raum Küche (device_get_state), identifiziert das richtige Deckenlicht anhand seiner Beschreibung in natürlicher Sprache und führt dann ein scene_create aus, das direkt funktioniert. Die Szene existiert wirklich dahinter, getestet und überprüft.

Was mich überzeugt hat: Es geht nicht nur darum, JSON zu erzeugen, das gut aussieht, sondern darum, das richtige Gerät anhand einer natürlichen Beschreibung zu finden, anstatt den exakten Namen zu verlangen oder einen ID zu improvisieren. Genau diese Art von Reibung ist der Grund, warum ich die Erstellung meiner Szenen immer aufschiebe — wenn ich den technischen Namen jedes Geräts auswendig kennen muss, damit es funktioniert, kann ich es auch manuell in der Oberfläche machen. Ein Assistent, der « das Küchen-Deckenlicht » versteht, ohne weitere Präzisierung, verändert wirklich die Spielregeln für die Akzeptanz durch die ganze Familie, nicht nur durch mich.

Danke für diese sehr umfassende Analyse, sie hilft mir enorm! :folded_hands:

Am Ende ist dein Feedback recht konsistent mit den technischen Fähigkeiten jedes Modells. Qwen 3.5 (379B) ist das größte Modell der Auswahl, und es ist auch in der Praxis das leistungsfähigste. :slightly_smiling_face:

@Chris75, ich wäre neugierig auf dein Feedback zu Qwen 3.5 (379B)!

Ich überlege auch, weitere Modelle hinzuzufügen, diesmal bei DigitalOcean in Deutschland gehostet, da das Angebot von Scaleway bei den leistungsstärksten Modellen noch recht begrenzt ist. Ich denke dabei insbesondere an DeepSeek V4 Pro, das ein hervorragendes Preis-Leistungs-Verhältnis bietet und bei DigitalOcean verfügbar ist.

Wir würden bei einer privaten Cloud-Infrastruktur in Europa bleiben.
Würde euch dieser Kompromiss akzeptabel erscheinen? :thinking:

Ich würde sagen ja, was mich betrifft: Europa, DSGVO (normalerweise von den Europäern eingehalten), die AGB und die Server-Hosting-Anbieter müssen noch geprüft werden.

Habt ihr schon bei unseren Schweizer Kollegen mit Proton und Infomaniak nachgefragt?

Ich habe noch nicht alles getestet, ich hatte vor allem viele Abstürze der KI, ich werde dir meine Logs per PN schicken. Jedenfalls haben die KIs Probleme mit meinem Pool :sweat_smile:
Ansonsten, welche KI nutzt du für die wöchentliche Zusammenfassung? Denn diese hier funktioniert sehr gut (immer im Verhältnis zu meinem Poolverbrauch und -kosten).

Also, ich habe viele Tests mit Qwen 3.5 397B a17b für den täglichen Gebrauch durchgeführt (Licht, Rollläden, Schalter, Sensorzustand/-historie, Steckdosenverbrauch, EDF-Verbrauch, Kameras) und tatsächlich sind die Ergebnisse besser als mit Qwen 3.6 35b.

Ich habe die Erstellung von Szenen nicht getestet.

Hauptprobleme: Die KI kann die Helligkeit/Farbe der Lichter nicht einstellen (das ist ein großes Manko), manchmal werden die Historie nicht gefunden, das Wetter wird nicht gefunden, der Batteriezustand wird nicht gefunden, usw.

Wie kann ich meine Stimme ändern?

Danke für deine Tests @Chris75, das ist super hilfreich! :folded_hands:

Ich habe gerade den Auto-Modus auf Qwen 3.5 397B A17B umgestellt. So sollten die Antworten, ob im Chat oder per Sprachausgabe, relevanter sein. Ich werde die Kosten im Auge behalten, um zu sehen, ob es sich lohnt, es als Standardmodell zu verwenden.

Allerdings bleibe ich für den wöchentlichen Digest bei Mistral Small 3.2. Mit Qwen 3.5 wird der Prompt so groß, dass das Modell mehr als 2 Minuten zum Antworten braucht, und am Ende erhalte ich keine besseren Ergebnisse als mit Mistral, laut meinen Tests.

Kannst du hier eine Anfrage erstellen? Demande de fonctionnalités - Gladys Assistant community

Das ist eine Funktion, die sich relativ einfach hinzufügen lässt, ich werde mich darum kümmern, sobald es möglich ist. :slightly_smiling_face:

Kannst du mir ein bisschen mehr dazu sagen? Hast du ein Beispiel für eine Frage, die nicht funktioniert hat?

Tatsächlich sind die Wetterdaten noch nicht für die KI verfügbar. Kannst du hier eine Anfrage erstellen? Demande de fonctionnalités - Gladys Assistant community

Gleiches gilt hier, es ist noch nicht verfügbar, aber es ist relativ einfach hinzuzufügen. Wenn du hier eine Anfrage erstellen kannst, werde ich es so schnell wie möglich hinzufügen: Demande de fonctionnalités - Gladys Assistant community :slightly_smiling_face:

FRAGE: « Wie hoch war der Verbrauch in kWh am Stecker des Wechselrichters am 12. Juli 2026? »

ANTWORT: Laut den Daten des Steckers des Wechselrichters sehe ich den kumulativen Verbrauchsverlauf in kWh. Allerdings sind die zurückgegebenen Daten gekürzt, und ich kann die genauen Werte an den Grenzen des 12. Juli 2026 (Mitternacht am 12. und Mitternacht am 13.) nicht sehen.

Was ich beobachten kann:

  • Am 10. Juli um etwa 12:30 Uhr: 48,99 kWh (kumuliert)
  • Am 11. Juli um etwa 23:45 Uhr: etwa 50,08 kWh (kumuliert)

Um den genauen Verbrauch des 12. Juli zu erhalten, müsste man den kumulierten Wert vom Ende des 11. Juli von dem des Endes des 12. Juli subtrahieren. Leider sind die genauen Daten für diesen Zeitraum im Ergebnis nicht vollständig sichtbar.

Möchten Sie, dass ich die Daten auf eine andere Weise oder für einen anderen Zeitraum überprüfe?

Genau, das ist aktuell mit den verfügbaren Tools nicht möglich :slight_smile:

Du kannst einen Feature-Request in Demande de fonctionnalités - Gladys Assistant community erstellen?

Danke!

Hallo zusammen!

Gute Neuigkeiten: Die KI von Gladys wird viel schneller und dabei auch relevanter.

Das Problem

Bei jeder neuen Funktion fügen wir Tools hinzu, die die KI nutzen kann (Licht einschalten, Temperatur lesen, eine Szene erstellen…). Allerdings werden alle diese Tools bei jeder Nachricht an das Modell gesendet. Das Ergebnis: Der Prompt wird schwerfälliger, und selbst ein einfaches „Schalte das Wohnzimmerlicht ein“ wird zu einer komplexen Anfrage, die analysiert werden muss. Es ist ein bekanntes Phänomen: Je mehr Tools verfügbar sind, desto schlechter wird die Präzision der Auswahl, unabhängig vom verwendeten Modell.

Die Lösung: Ein zweistufiges Routing

Statt eines einzigen großen Aufrufs machen wir zwei:

  1. Klassifizierung: Ein leichtes und schnelles Modell erhält nur die Liste der Tools und bestimmt den Typ der Anfrage.
  2. Ausführung: Die echte Anfrage wird nur mit den nützlichen Tools gesendet. Das schwerste Tool, scene.create, wird nur geladen, wenn die Anfrage als Szenen-Erstellung klassifiziert wurde.

Diese Klassifizierungsstufe bringt einen zweiten Vorteil: Sie ermöglicht es, den „Reflexionsmodus“ des Modells bei einfachen Anfragen zu deaktivieren, wo er oft mehrere Sekunden unnötig hinzufügte. Die Szenen-Erstellung behält jedoch diesen Denkmodus, weil sie ihn wirklich braucht, um zuverlässig zu bleiben.

Konkrete Auswirkungen für euch

Bei einem häufigen Befehl (Licht, Temperatur, Rollladen…) reduziert sich die Zeit von 10 bis 15 Sekunden in den schlimmsten Fällen auf nur noch wenige Sekunden. Der KI-Teil der Kette sinkt sogar unter eine Sekunde.

Das wird in der nächsten Version von Gladys verfügbar sein!

perfekt, ich freue mich auf diese Version!