La empresa de IA de audio Modulate ha recaudado 25 millones de dólares en financiación adicional para ampliar la tecnología diseñada para identificar habla sintética, conversaciones dañinas y otros riesgos basados en la voz en tiempo real.
La ronda fue liderada por Future Ventures, con la participación de Hyperplane y Lakestar. Modulate afirmó que la inversión eleva su financiación total a 60 millones de dólares.
La empresa desarrolla modelos de IA centrados en el audio para su plataforma Velma, destinada a evaluar características que podrían pasar desapercibidas únicamente mediante la transcripción de texto. Estas señales incluyen el tono, la emoción, la intención, el comportamiento conversacional y los indicadores de habla generada por IA.
Modulate afirmó que su sistema combina más de 100 modelos especializados basados en su arquitectura Ensemble Listening Model. Según la empresa, la plataforma procesa más de 10 millones de horas de audio al mes y ha analizado más de 600 millones de horas en total. La empresa también indicó que sus modelos de transcripción y detección de deepfakes han obtenido buenos resultados en pruebas de referencia públicas, aunque dichas afirmaciones no fueron verificadas de forma independiente en el anuncio.
Enfoque en la intervención en tiempo real
La clonación de voz y otras formas de audio sintético se han convertido en una preocupación creciente para las organizaciones que utilizan centros de llamadas, asistentes de voz y sistemas automatizados de atención al cliente. Los estafadores pueden utilizar voces sintéticas convincentes en esquemas de ingeniería social, mientras que las voces alteradas o enmascaradas también pueden complicar los esfuerzos de moderación y verificación de identidad.
Modulate afirma que Velma está diseñada para permitir la detección en directo, lo que permite a los clientes responder durante una interacción en lugar de hacerlo después de revisar una grabación. Entre los posibles usos citados por la empresa se encuentran la identificación de fraude facilitado por deepfakes dirigido a organizaciones sanitarias, la detección de acoso o contenido extremista en plataformas de comunicaciones, la protección de usuarios vulnerables frente a conversaciones de captación y la evaluación del comportamiento de agentes de IA de voz.
La empresa también presenta la tecnología como una forma de ayudar a las aplicaciones de voz a reconocer emociones y mejorar la manera en que los agentes automatizados responden a los usuarios. Estas implementaciones pueden requerir una gobernanza cuidadosa, especialmente cuando los sistemas analizan conversaciones sensibles o toman decisiones que afectan a los usuarios en tiempo real.
Planes de inversión
Modulate indicó que utilizará el nuevo capital para ampliar su equipo y su infraestructura, expandir su oferta de modelos y desarrollar API adicionales, kits de desarrollo de software, integraciones y opciones de implementación para desarrolladores y socios.
El director ejecutivo y cofundador, Carter Huffman, afirmó que el audio requiere un análisis que va más allá de una transcripción escrita, especialmente a medida que la voz se convierte en una interfaz más habitual para los sistemas de IA. La financiación refleja el continuo interés de los inversores en herramientas destinadas a contrarrestar el uso indebido de la IA generativa, incluidas las capacidades de clonación de voz cada vez más accesibles.
