← Zurück zu den Neuigkeiten
SecurityWeek28 Sept 2026 · 2 Min. Lesezeit

Modulate sichert sich 25 Millionen US-Dollar zur Erweiterung der Technologie zur Erkennung von Voice-Deepfakes

Das Audio-KI-Unternehmen Modulate hat zusätzliche 25 Millionen US-Dollar an Finanzmitteln eingeworben, um Technologien auszubauen, die synthetische Sprache, schädliche Gespräche und andere sprachbasie...

Das Audio-KI-Unternehmen Modulate hat zusätzliche 25 Millionen US-Dollar an Finanzmitteln eingeworben, um Technologien auszubauen, die synthetische Sprache, schädliche Gespräche und andere sprachbasierte Risiken in Echtzeit erkennen sollen.

Die Finanzierungsrunde wurde von Future Ventures angeführt, unter Beteiligung von Hyperplane und Lakestar. Modulate teilte mit, dass sich die Gesamtfinanzierung des Unternehmens durch die Investition auf 60 Millionen US-Dollar erhöht.

Das Unternehmen entwickelt auf Audio ausgerichtete KI-Modelle für seine Velma-Plattform, die Merkmale bewerten soll, welche allein durch Texttranskription möglicherweise nicht erfasst werden. Zu diesen Signalen zählen Tonfall, Emotionen, Absichten, Gesprächsverhalten und Hinweise auf KI-generierte Sprache.

Modulate erklärte, sein System kombiniere mehr als 100 spezialisierte Modelle, die auf seiner Architektur Ensemble Listening Model basieren. Nach Angaben des Unternehmens verarbeitet die Plattform monatlich mehr als 10 Millionen Stunden Audio und hat insgesamt mehr als 600 Millionen Stunden analysiert. Das Unternehmen erklärte zudem, dass seine Transkriptions- und Deepfake-Erkennungsmodelle bei öffentlichen Benchmarks gute Ergebnisse erzielt hätten, wobei diese Angaben in der Ankündigung nicht unabhängig überprüft wurden.

Fokus auf Eingriffe in Echtzeit

Voice Cloning und andere Formen synthetischer Audiodateien sind zu einem wachsenden Problem für Unternehmen geworden, die Callcenter, Sprachassistenten und automatisierte Kundendienstsysteme einsetzen. Betrüger können überzeugende synthetische Stimmen für Social-Engineering-Angriffe nutzen, während veränderte oder maskierte Stimmen auch Moderations- und Identitätsprüfungsmaßnahmen erschweren können.

Modulate zufolge ist Velma für die Live-Erkennung konzipiert, sodass Kunden während einer Interaktion reagieren können, statt erst nach der Überprüfung einer Aufzeichnung. Zu den vom Unternehmen genannten potenziellen Einsatzbereichen gehören die Identifizierung von durch Deepfakes ermöglichtem Betrug gegen Organisationen im Gesundheitswesen, die Erkennung von Belästigung oder extremistischen Inhalten auf Kommunikationsplattformen, der Schutz gefährdeter Nutzer vor Grooming-Gesprächen sowie die Bewertung des Verhaltens von Sprach-KI-Agenten.

Das Unternehmen positioniert die Technologie zudem als Möglichkeit, Sprachanwendungen dabei zu unterstützen, Emotionen zu erkennen und die Reaktionen automatisierter Agenten auf Nutzer zu verbessern. Solche Implementierungen können eine sorgfältige Governance erfordern, insbesondere wenn Systeme sensible Gespräche analysieren oder Entscheidungen treffen, die Nutzer in Echtzeit betreffen.

Investitionspläne

Modulate erklärte, das neue Kapital für den Ausbau seines Teams und seiner Infrastruktur, die Erweiterung seines Modellangebots sowie die Entwicklung zusätzlicher APIs, Software Development Kits, Integrationen und Bereitstellungsoptionen für Entwickler und Partner einzusetzen.

Chief Executive und Mitgründer Carter Huffman erklärte, dass Audio eine Analyse erfordere, die über ein schriftliches Transkript hinausgehe, insbesondere da Sprache zu einer immer häufigeren Schnittstelle für KI-Systeme werde. Die Finanzierung spiegelt das anhaltende Interesse von Investoren an Werkzeugen wider, die dem Missbrauch generativer KI entgegenwirken sollen, einschließlich zunehmend zugänglicher Funktionen zum Klonen von Stimmen.

Diesen Artikel teilen:TwitterLinkedIn