Warum ich für Qwen 3.5 (379B) gestimmt habe
Ein kleiner Test, der das wert ist, was er wert ist (ein einzelner Fall, keine wissenschaftliche Studie
), der mir aber die Unterschiede zwischen den Modellen gut aufgezeigt hat.
Warum genau eine Szene testen? Weil das genau das ist, was mich im Alltag am meisten bremst. Ein einfacher Befehl (« Küche an »), damit kommt jedes Modell klar. Aber eine Szene ist oft komplexer und länger zu beschreiben, daher aufschlussreicher, ob das Modell wirklich nachdenkt oder nur blufft.
Ich habe gefragt: « Erstelle eine Szene, die das Küchen-Deckenlicht automatisch 30 Sekunden nach dem Einschalten ausschaltet », ohne den genauen Namen des Geräts im Prompt anzugeben (der echte Name ist Plafonniers 3 Ampullen, Raum Küche). Und das war Absicht, denn im echten Leben kennt meine Partnerin zum Beispiel nicht die technischen Spitznamen der Geräte, sie beschreibt einfach, was sie tun oder wo sie sind (« das Küchen-Deckenlicht », « die Lampe neben dem Sofa »…). Ein Assistent, der den exakten Namen braucht, um zu funktionieren, ist für sie nicht nutzbar.
Der Crash-Test pro Modell:
- Mistral Small und Holo2-30B: direkt im Kampf gefallen, die API ist bei jedem Versuch abgestürzt. Nichts zu holen.
- Gemma 4 und Gemma 3-27B: Sie versuchen,
scene_create aufzurufen, aber sie erfinden Dinge (falsche device_feature, nicht existierende Icons) → Boom, Fehler 422. Gemma 3-27B hatte immerhin den richtigen Reflex, den Zustand vorher zu prüfen (device_get_state), ist aber am Ende am Namen gescheitert.
- Qwen3.6: Fehler bei der Erstellung, dann ist auch die API abgestürzt.
- Pixtral 12B: Das Schlimmste im Modus « Ich tu nur so ». Er spuckt das JSON in einer Schleife aus und sagt « Jetzt führe ich es aus », ruft aber nie wirklich das Tool auf, selbst wenn du ihm dreimal hintereinander sagst « Los », « Ruf die Funktion auf ».
- Llama 3.3-70B: Gute Reflexe bei der Logik (Verzögerung + Ausschalten), aber ungültige device_feature und Icons → 422 direkt.
- Qwen3-235B: Der hinterhältigste von allen. Er verkündet « Die Szene wurde erfolgreich erstellt », obwohl er kein Tool aufgerufen hat. Kein Tool-Aufruf, reine Halluzination von Erfolg. Das Schlimmste für mich, der stille falsche Positivfall, der dich glauben lässt, du hättest ein Auto, obwohl du nichts hast.
- Qwen 3.5 (379B): Das einzige der neun, das das richtige Gerät allein finden konnte. Er prüft zuerst den Zustand der Geräte im Raum Küche (
device_get_state), identifiziert das richtige Deckenlicht anhand seiner Beschreibung in natürlicher Sprache und führt dann ein scene_create aus, das direkt funktioniert. Die Szene existiert wirklich dahinter, getestet und überprüft.
Was mich überzeugt hat: Es geht nicht nur darum, JSON zu erzeugen, das gut aussieht, sondern darum, das richtige Gerät anhand einer natürlichen Beschreibung zu finden, anstatt den exakten Namen zu verlangen oder einen ID zu improvisieren. Genau diese Art von Reibung ist der Grund, warum ich die Erstellung meiner Szenen immer aufschiebe — wenn ich den technischen Namen jedes Geräts auswendig kennen muss, damit es funktioniert, kann ich es auch manuell in der Oberfläche machen. Ein Assistent, der « das Küchen-Deckenlicht » versteht, ohne weitere Präzisierung, verändert wirklich die Spielregeln für die Akzeptanz durch die ganze Familie, nicht nur durch mich.