L’entreprise d’IA audio Modulate a levé 25 millions de dollars de financement supplémentaire afin d’étendre une technologie conçue pour identifier en temps réel la parole synthétique, les conversations nuisibles et d’autres risques liés à la voix.
Le tour de table a été mené par Future Ventures, avec la participation de Hyperplane et Lakestar. Modulate a indiqué que cet investissement porte son financement total à 60 millions de dollars.
L’entreprise développe des modèles d’IA axés sur l’audio pour sa plateforme Velma, destinée à évaluer des caractéristiques susceptibles d’échapper à la seule transcription de texte. Ces signaux incluent le ton, l’émotion, l’intention, le comportement conversationnel et des indicateurs de parole générée par IA.
Modulate a indiqué que son système combine plus de 100 modèles spécialisés reposant sur son architecture Ensemble Listening Model. Selon l’entreprise, la plateforme traite plus de 10 millions d’heures d’audio par mois et a analysé plus de 600 millions d’heures au total. L’entreprise a également affirmé que ses modèles de transcription et de détection de deepfakes ont obtenu de solides résultats sur des benchmarks publics, bien que ces affirmations n’aient pas été vérifiées de manière indépendante dans l’annonce.
Priorité à l’intervention en temps réel
Le clonage vocal et d’autres formes d’audio synthétique sont devenus une préoccupation croissante pour les organisations utilisant des centres d’appels, des assistants vocaux et des systèmes automatisés de service client. Les fraudeurs peuvent utiliser des voix synthétiques convaincantes dans des stratagèmes d’ingénierie sociale, tandis que des voix modifiées ou masquées peuvent également compliquer les efforts de modération et de vérification d’identité.
Modulate affirme que Velma est conçu pour prendre en charge la détection en direct, permettant aux clients de réagir au cours d’une interaction plutôt qu’après examen d’un enregistrement. Parmi les usages potentiels cités par l’entreprise figurent l’identification de fraudes facilitées par des deepfakes visant des organisations de santé, la détection de harcèlement ou de contenus extrémistes sur des plateformes de communication, la protection des utilisateurs vulnérables contre les conversations de grooming, ainsi que l’évaluation du comportement des agents d’IA vocale.
L’entreprise présente également cette technologie comme un moyen d’aider les applications vocales à reconnaître les émotions et à améliorer la façon dont les agents automatisés répondent aux utilisateurs. De tels déploiements peuvent nécessiter une gouvernance rigoureuse, en particulier lorsque les systèmes analysent des conversations sensibles ou prennent en temps réel des décisions affectant les utilisateurs.
Plans d’investissement
Modulate a indiqué qu’elle utilisera les nouveaux capitaux pour développer ses équipes et son infrastructure, élargir son offre de modèles et concevoir des API supplémentaires, des kits de développement logiciel, des intégrations et des options de déploiement destinés aux développeurs et aux partenaires.
Le directeur général et cofondateur Carter Huffman a déclaré que l’audio exige une analyse allant au-delà d’une transcription écrite, en particulier à mesure que la voix devient une interface plus courante pour les systèmes d’IA. Ce financement reflète l’intérêt continu des investisseurs pour les outils destinés à contrer l’utilisation abusive de l’IA générative, notamment les capacités de clonage vocal de plus en plus accessibles.
