Bonjour à tous,
Depuis quelques temps maintenant je tease à Pierre-Gilles un nouveau service basé sur Gradium. C’est une startup française autour de l’IA de la voix qui fait beaucoup parler d’elle. L’abonnement gratuit permet 1h de text-to-speech par mois.
L’idée du service est de permettre à ceux qui souhaite bidouiller un peu de choisir une voix personnalisée (ils proposent même la voix du Général de Gaulle), ou de tester du TTS gratuitement pour les nouveaux utilisateurs Gladys.
Une nouvelle fois, Gladys Plus vous permet déjà d’avoir une voix clé en main, et permet de soutenir le projet donc n’hésitez pas à souscrire à Gladys Plus.
Côté développeur c’est un premier pas qui a permis d’ajouter une abstraction de tts et mon prochain objectif est de faire marcher des modèles locaux. @McFlyPartages avais parlé de supertonic, la v3 est sortie récemment et est encore plus performante. Mes premiers tests sont assez concluants, mais j’essaie de faire des comparaisons avec d’autres modèles dispo sur HunggingFace, j’espère vous proposer quelque chose prochainement.
En attendant pour le service Gradium, j’ai testé avec Airplay, j’aurai besoin de testeurs sur Google Cast et Sonos, une image docker est disponible bertrandda/gladys:gradium
Salut merci pour ton travail.
Je sais qu’il y a aussi Voxtral qui tourne en local avec de très bonne performances mais pas testé encore.
Si j’ai le temps de tester ton développement, je te ferais un retour, j’ai des enceintes sonos (Ikea)
Oui j’ai vu, mais Voxtral semble marcher à partir d’une bonne petite config. Mes tests de supertonic sur Raspberry PI 4 8Go m’ont permis de générer des audios d’une petite dizaine de secondes en ~8 secondes. Voilà quelques exemples générés en Nodejs sur RPI 4 (les liens sont valables 7 jours je pourrais les réuploader si nécessaire) :
D’autres voix sont dispos dont des voix masculines
Si ça tourne sur PI4 ça tourne sur de meilleures machines (avec encore de meilleurs rendus, en augmentant le paramètre total_steps par exemple). Le CPU du RPI 4 date de 2021 (cf benchmark ci dessous) avec des appareils plus récents (comme avec les Beelink proposés via les kit Gladys clé en main) le temps de latence sera assurément plus faible.
À noter que dans ce que j’imagine, l’objectif de Gradium et plus tard des modèles locaux est d’avoir des alternatives pour le bloc Notification audio dans les scènes uniquement (pas le widget assistant vocal du dashboard qui nécessite un llm et donc Gladys Plus), donc avoir quelques secondes de délai ne me semble pas très grave.
Et une fois un premier modèle local implémenté, rien n’empêche d’en ajouter d’autres plus gros pour les machines plus musclées.
En attendant, pour ceux qui veulent tester Gradium, une image avec les derniers fix est disponible bertrandda/gladys:gradium