Service Gradium AI

Hallo zusammen,

Seit einiger Zeit tease ich Pierre-Gilles nun einen neuen Dienst auf Basis von Gradium. Es handelt sich um ein französisches Startup im Bereich der Sprach-KI, das viel von sich reden macht. Das kostenlose Abonnement ermöglicht 1 Stunde Text-to-Speech pro Monat.

Die Idee des Dienstes ist es, denen, die ein wenig herumexperimentieren möchten, die Wahl einer personalisierten Stimme zu ermöglichen (sie bieten sogar die Stimme von General de Gaulle an) oder TTS kostenlos für neue Gladys-Nutzer zu testen.

Wie immer ermöglicht Gladys Plus Ihnen bereits eine fertige Stimme und unterstützt das Projekt, also zögern Sie nicht, sich für Gladys Plus anzumelden.

Für Entwickler ist dies ein erster Schritt, der es ermöglicht, eine TTS-Abstraktion hinzuzufügen, und mein nächstes Ziel ist es, lokale Modelle zum Laufen zu bringen. @McFlyPartages hat über supertonic gesprochen, die Version 3 ist kürzlich erschienen und noch leistungsfähiger. Meine ersten Tests sind recht vielversprechend, aber ich versuche, Vergleiche mit anderen Modellen auf HuggingFace anzustellen, ich hoffe, Ihnen bald etwas anzubieten.

In der Zwischenzeit habe ich den Dienst Gradium mit Airplay getestet, ich brauche Tester für Google Cast und Sonos, ein Docker-Image ist verfügbar bertrandda/gladys:gradium

Hallo, danke für deine Arbeit.

Ich weiß, dass es auch Voxtral gibt, das lokal läuft und sehr gute Leistungen erbringt, aber noch nicht getestet wurde.

Wenn ich Zeit habe, dein Entwicklung zu testen, gebe ich dir Feedback, ich habe Sonos-Lautsprecher (Ikea).

Ja, ich habe es gesehen, aber Voxtral scheint ab einer guten kleinen Konfiguration zu funktionieren. Meine Tests von supertonic auf einem Raspberry PI 4 mit 8 GB RAM haben mir ermöglicht, Audios von etwa zehn Sekunden in ~8 Sekunden zu generieren. Hier sind einige Beispiele, die in Nodejs auf dem RPI 4 generiert wurden (die Links sind 7 Tage gültig, ich könnte sie bei Bedarf erneut hochladen):

Es gibt auch andere Stimmen, darunter männliche Stimmen.

Wenn es auf dem PI4 läuft, läuft es auch auf besseren Maschinen (mit noch besseren Ergebnissen, indem man z. B. den Parameter total_steps erhöht). Der CPU des RPI 4 stammt aus dem Jahr 2021 (siehe Benchmark unten), mit neueren Geräten (wie den Beelink-Geräten, die über die Gladys-All-in-One-Kits) wird die Latenzzeit sicherlich geringer sein.

Zu beachten ist, dass in dem, was ich mir vorstelle, das Ziel von Gradium und später lokaler Modelle darin besteht, Alternativen für den Block „Audio-Benachrichtigung“ in den Szenen (nicht das Sprachassistenten-Widget des Dashboards, das ein LLM und damit Gladys Plus erfordert) zu haben, sodass mir einige Sekunden Verzögerung nicht sehr schlimm erscheinen.

Und sobald ein erstes lokales Modell implementiert ist, spricht nichts dagegen, weitere, größere Modelle für leistungsfähigere Maschinen hinzuzufügen.

In der Zwischenzeit, für diejenigen, die Gradium testen möchten, ist ein Image mit den letzten Fixes verfügbar bertrandda/gladys:gradium

Hallo @bertrandda,

Wie ich dir in deinem PR gesagt habe, denke ich, dass diese Integration eine externe Integration sein wird :slight_smile:

Ich habe die Spezifikation und die Verwaltung der « Text-To-Speech »-Anbieter entwickelt:

Hallo, ich habe in den drei Wochen meiner Abwesenheit viel verpasst, es hat sich viel verändert, Gladys :laughing: (natürlich zum Besseren).

Ich würde gerne daran arbeiten, ich denke, ich fange damit an, Nextcloud Talk zu migrieren, um mich mit den externen Integrationen vertraut zu machen, und dann kümmere ich mich um Gradium, wenn du den TTS in das SDK gemerged hast.

Oh Mann, wenn du drei Wochen verpasst hast, ist es beim Zurückkommen nicht mehr dasselbe Projekt :joy::joy:

Toll!