VALL-E: Diese KI imitiert menschliche Stimmen nach nur drei Sekunden

Microsoft hat eine neue Künstliche Intelligenz (KI) namens VALL-E entwickelt, die menschliche Stimmen imitieren kann. Eine drei Sekunden lange Sprachprobe reicht dafür offenbar bereits aus.

Künstliche Intelligenz und KI-Tools spielen eine immer größere Rolle. Den Algorithmen fehlt es dennoch oftmals an vielen menschlichen Eigenschaften – etwa dem eigenständigen Denken. So entstanden bereits historische Texte von Bären im Weltall. Dennoch zeigen Tools wie ChatGPT, was heutzutage möglich ist.

Dass die täuschend echt wirkende Kommunikation mit einer Maschine auch über Texte hinausgehen kann, zeigt nun Microsoft. Das Unternehmen stellte kürzlich ein eigenes TTS-Modell (Text-To-Speech) namens VALL-E vor. Das Gruselige daran: Es kann Menschen täuschend echt imitieren. VALL-E benötigt dafür nämlich nur drei Sekunden einer Sprachaufnahme.

VALL-E imitiert menschliche Stimmen

Die KI kann so jeden Menschen auf der Welt täuschend echt nachahmen. Das System basiert dabeiauf einer Technologie namens EnCodec des Technologie-Unternehmens Meta, die der US-Konzern erstmals im Oktober 2022 ankündigte. Die Künstliche Intelligenz analysiert derweil, wie eine Person spricht. Dazu nutzt sie Trainingsdaten, um andere Tonlagen zu simulieren.

Für ein natürliches Stimmbild reichen drei Sekunden einer Audioaufnahme aus. In der Theorie ließen sich so Sprachassistenten erstellen, die wie Barack Obama oder Angela Merkel klingen.

Für ein noch besseres Ergebnis sorgen Trainingsdaten der Audiobibliothek LibriLight – ebenfalls eine Schöpfung von Meta. Diese beinhaltet 60.000 Stunden Audioaufnahmen von 7.000 englischen Sprecherinnen und Sprechern.

Neues Modell birgt einige Risiken

Auch möglich sein soll die Simulation einer akustischen Umwelt zur Stimme. Nimmt das System etwa eine Stimmprobe am Telefon entgegen, so klingt das fertige Modell ebenfalls wie eine Person am Telefon. Wie sich jeder denken kann, birgt dieser Ansatz aber viele Risiken. Das sieht auch Microsoft so.

Um den Missbrauch des Modells zu verhindern, entwickelte das Unternehmen deshalb ein Erkennungsmodell, das klar sagen kann, ob eine Aufnahme von VALL-E stammt. Das soll den Umstand vorbeugen, dass Kriminelle die Technologie für Authentifizierungen oder andere Vorkommen missbrauchen. Ob das reichen wird, bleibt aber abzuwarten.

Auch interessant:

		Content Creator Schwerpunkt Grafik (m/w/d) ab... BAUHAUS in Mannheim
		Videograph/in / Visual Content Creator – Moti... Internet Value GmbH in Düsseldorf
		Marketingassistenz – Schwerpunkt digitale Kom... Erich Werkmeister GmbH & Co. KG in Henstedt-Ulzburg
		Social-Media-Manager:in (m/w/d) Zentralinstitut für die kassenärztliche Ve... in Berlin
		Senior Social Media Manager*in (m/w/d) Sparda-Bank Berlin eG in Berlin
		IT Solution Architect \| Integrated Planning Bosch Gruppe in Reutlingen

BASIC thinking UPDATE

VALL-E imitiert menschliche Stimmen

Neues Modell birgt einige Risiken

Customer Experience: Die Erfolgsstory von Körber Supply Chain Software