VALL-E: Diese KI imitiert menschliche Stimmen nach nur drei Sekunden

Microsoft hat eine neue Künstliche Intelligenz (KI) namens VALL-E entwickelt, die menschliche Stimmen imitieren kann. Eine drei Sekunden lange Sprachprobe reicht dafür offenbar bereits aus.

Künstliche Intelligenz und KI-Tools spielen eine immer größere Rolle. Den Algorithmen fehlt es dennoch oftmals an vielen menschlichen Eigenschaften – etwa dem eigenständigen Denken. So entstanden bereits historische Texte von Bären im Weltall. Dennoch zeigen Tools wie ChatGPT, was heutzutage möglich ist.

Dass die täuschend echt wirkende Kommunikation mit einer Maschine auch über Texte hinausgehen kann, zeigt nun Microsoft. Das Unternehmen stellte kürzlich ein eigenes TTS-Modell (Text-To-Speech) namens VALL-E vor. Das Gruselige daran: Es kann Menschen täuschend echt imitieren. VALL-E benötigt dafür nämlich nur drei Sekunden einer Sprachaufnahme.

VALL-E imitiert menschliche Stimmen

Die KI kann so jeden Menschen auf der Welt täuschend echt nachahmen. Das System basiert dabeiauf einer Technologie namens EnCodec des Technologie-Unternehmens Meta, die der US-Konzern erstmals im Oktober 2022 ankündigte. Die Künstliche Intelligenz analysiert derweil, wie eine Person spricht. Dazu nutzt sie Trainingsdaten, um andere Tonlagen zu simulieren.

Für ein natürliches Stimmbild reichen drei Sekunden einer Audioaufnahme aus. In der Theorie ließen sich so Sprachassistenten erstellen, die wie Barack Obama oder Angela Merkel klingen.

Für ein noch besseres Ergebnis sorgen Trainingsdaten der Audiobibliothek LibriLight – ebenfalls eine Schöpfung von Meta. Diese beinhaltet 60.000 Stunden Audioaufnahmen von 7.000 englischen Sprecherinnen und Sprechern.

Neues Modell birgt einige Risiken

Auch möglich sein soll die Simulation einer akustischen Umwelt zur Stimme. Nimmt das System etwa eine Stimmprobe am Telefon entgegen, so klingt das fertige Modell ebenfalls wie eine Person am Telefon. Wie sich jeder denken kann, birgt dieser Ansatz aber viele Risiken. Das sieht auch Microsoft so.

Um den Missbrauch des Modells zu verhindern, entwickelte das Unternehmen deshalb ein Erkennungsmodell, das klar sagen kann, ob eine Aufnahme von VALL-E stammt. Das soll den Umstand vorbeugen, dass Kriminelle die Technologie für Authentifizierungen oder andere Vorkommen missbrauchen. Ob das reichen wird, bleibt aber abzuwarten.

Auch interessant:

Sachbearbeiter Verwaltungsdigitalisierung (m/... Landratsamt Schwäbisch Hall in Schwäbisch Hall
		Freiberuflicher Redakteur (m/w/d) BASIC thinking GmbH in Home Office
		Leitung Kompetenzzentrum für Kommunikation, M... Malteser in Deutschland in Limburg,Frankfurt am Main...
		Digital Marketing Manager/ Content Creator (m... Walther-Werke Ferdinand Walther GmbH in Eisenberg (P...
		Datenschutzmanager im Gesundheitswesen für di... Vitos gGmbH in Bad Emstal
		Senior Social Media Manager (m/w/d) & Cre... hitschler International GmbH & Co. KG in Hürth

BASIC thinking UPDATE

VALL-E imitiert menschliche Stimmen

Neues Modell birgt einige Risiken

Einmal zahlen, ein Leben lang Online-Speicher erhalten

LESEEMPFEHLUNGEN

Mit neuer Nummer eins: Die wertvollsten KI-Unternehmen der Welt

Zink-Iod-Batterien: Trocken-Elektroden verdoppeln Leistung

KI-Assistenten von ChatGPT: So kannst du eigene GPTs erstellen

Super-Transistoren sollen Elektronik schneller und effizienter machen

Die hartnäckigsten Elektroauto-Mythen – und was an ihnen dran ist

Festival der Zukunft 2025 in München: Alles, was du wissen musst