Hace algún tiempo que le estoy dando vueltas a Pierre-Gilles sobre un nuevo servicio basado en Gradium. Es una startup francesa de IA de voz que está dando mucho que hablar. La suscripción gratuita permite 1 hora de texto a voz por mes.
La idea del servicio es permitir a quienes quieran experimentar un poco elegir una voz personalizada (incluso ofrecen la voz del General de Gaulle), o probar el TTS de forma gratuita para los nuevos usuarios de Gladys.
Una vez más, Gladys Plus ya te permite tener una voz lista para usar, y te permite apoyar el proyecto, así que no dudes en suscribirte a Gladys Plus.
Para los desarrolladores, es un primer paso que ha permitido añadir una abstracción de TTS y mi próximo objetivo es hacer funcionar modelos locales. @McFlyPartages había hablado de supertonic, la v3 salió recientemente y es aún más potente. Mis primeras pruebas son bastante concluyentes, pero estoy haciendo comparaciones con otros modelos disponibles en HunggingFace, espero poder ofreceros algo pronto.
Mientras tanto, para el servicio Gradium, lo he probado con Airplay, necesitaré probadores en Google Cast y Sonos, una imagen docker está disponible bertrandda/gladys:gradium
Sí, lo he visto, pero Voxtral parece funcionar a partir de una buena configuración. Mis pruebas de supertonic en Raspberry PI 4 8GB me permitieron generar audios de unos pocos segundos en ~8 segundos. Aquí hay algunos ejemplos generados en Nodejs en RPI 4 (los enlaces son válidos por 7 días, puedo volver a subirlos si es necesario):
Hay otras voces disponibles, incluyendo voces masculinas
Si funciona en PI4, funcionará en máquinas mejores (con aún mejores resultados, aumentando el parámetro total_steps por ejemplo). El CPU del RPI 4 es de 2021 (ver benchmark a continuación) con dispositivos más recientes (como los Beelink ofrecidos a través de los kits Gladys llave en mano) el tiempo de latencia será sin duda más bajo.
Cabe señalar que en lo que imagino, el objetivo de Gradium y más tarde de los modelos locales es tener alternativas para el bloque de notificación de audio en las escenas (solo, no el widget de asistente de voz del panel de control que requiere un LLM y, por lo tanto, Gladys Plus), por lo que tener unos segundos de retraso no me parece muy grave.
Y una vez que se implemente un primer modelo local, nada impide agregar otros más grandes para las máquinas más potentes.
Mientras tanto, para aquellos que quieran probar Gradium, una imagen con los últimos parches está disponible bertrandda/gladys:gradium
Hola, me he perdido muchas cosas en 3 semanas de ausencia, ha cambiado mucho Gladys (para mejor, evidentemente).
Me gustaría trabajar en ello, creo que empezaré migrando Nextcloud Talk para practicar con las integraciones externas y luego me ocuparé de Gradium cuando hayas fusionado el TTS en el SDK