KI, Meta, Microsoft, Künstliche Intelligenz, Vall-e, Stimme, menschliche Stimme

VALL-E: Diese KI imitiert menschliche Stimmen nach nur drei Sekunden

Felix Baumann
Adobe Stock/ Vectoro

Microsoft hat eine neue Künstliche Intelligenz (KI) namens VALL-E entwickelt, die menschliche Stimmen imitieren kann. Eine drei Sekunden lange Sprachprobe reicht dafür offenbar bereits aus.

Künstliche Intelligenz und KI-Tools spielen eine immer größere Rolle. Den Algorithmen fehlt es dennoch oftmals an vielen menschlichen Eigenschaften – etwa dem eigenständigen Denken. So entstanden bereits historische Texte von Bären im Weltall. Dennoch zeigen Tools wie ChatGPT, was heutzutage möglich ist.

Dass die täuschend echt wirkende Kommunikation mit einer Maschine auch über Texte hinausgehen kann, zeigt nun Microsoft. Das Unternehmen stellte kürzlich ein eigenes TTS-Modell (Text-To-Speech) namens VALL-E vor. Das Gruselige daran: Es kann Menschen täuschend echt imitieren. VALL-E benötigt dafür nämlich nur drei Sekunden einer Sprachaufnahme.

UPDATE Newsletter BASIC thinking

Du willst nicht abgehängt werden, wenn es um KI, Green Tech und die Tech-Themen von Morgen geht? Über 12.000 Vordenker bekommen jeden Tag die wichtigsten News direkt in die Inbox und sichern sich ihren Vorsprung.

Nur für kurze Zeit: Anmelden und mit etwas Glück 50€ Amazon-Guthaben gewinnen!

Mit deiner Anmeldung bestätigst du unsere Datenschutzerklärung. Beim Gewinnspiel gelten die AGB.

VALL-E imitiert menschliche Stimmen

Die KI kann so jeden Menschen auf der Welt täuschend echt nachahmen. Das System basiert dabeiauf einer Technologie namens EnCodec des Technologie-Unternehmens Meta, die der US-Konzern erstmals im Oktober 2022 ankündigte. Die Künstliche Intelligenz analysiert derweil, wie eine Person spricht. Dazu nutzt sie Trainingsdaten, um andere Tonlagen zu simulieren.

Für ein natürliches Stimmbild reichen drei Sekunden einer Audioaufnahme aus. In der Theorie ließen sich so Sprachassistenten erstellen, die wie Barack Obama oder Angela Merkel klingen.

Für ein noch besseres Ergebnis sorgen Trainingsdaten der Audiobibliothek LibriLight – ebenfalls eine Schöpfung von Meta. Diese beinhaltet 60.000 Stunden Audioaufnahmen von 7.000 englischen Sprecherinnen und Sprechern.

Neues Modell birgt einige Risiken

Auch möglich sein soll die Simulation einer akustischen Umwelt zur Stimme. Nimmt das System etwa eine Stimmprobe am Telefon entgegen, so klingt das fertige Modell ebenfalls wie eine Person am Telefon. Wie sich jeder denken kann, birgt dieser Ansatz aber viele Risiken. Das sieht auch Microsoft so.

Um den Missbrauch des Modells zu verhindern, entwickelte das Unternehmen deshalb ein Erkennungsmodell, das klar sagen kann, ob eine Aufnahme von VALL-E stammt. Das soll den Umstand vorbeugen, dass Kriminelle die Technologie für Authentifizierungen oder andere Vorkommen missbrauchen. Ob das reichen wird, bleibt aber abzuwarten.

Auch interessant:

Du möchtest nicht abgehängt werden, wenn es um KI, Green Tech und die Tech-Themen von Morgen geht? Über 12.000 smarte Leser bekommen jeden Tag UPDATE, unser Tech-Briefing mit den wichtigsten News des Tages – und sichern sich damit ihren Vorsprung. Hier kannst du dich kostenlos anmelden.

STELLENANZEIGEN
Openstack Engineer (m/f/d)
CompuGroup Medical SE & Co. KGaA in Koblenz
Digital Marketing Manager*in (w/m/d)
TÜV Rheinland Group in Köln
Werkstudent Online-Marketing / Social Media (...
HAUPTSTADT RAEUME c/o Esplanaden Immobilie... in Berlin
Duales Studium zum Bachelor of Science (DH), ...
DZ BANK AG in Frankfurt am Main
Social Media Manager & Content Creator (d...
die wegmeister gmbh in Stuttgart
Marketing Manager (w/m/d) Schwerpunkt Online ...
Horváth in Frankfurt, Hamburg, München, Stuttgart
Kaufmännischer Mitarbeiter für den Bereich E-...
tetris Unternehmensberater GbR in Bielefeld
Werkstudent*in Teilnehmermanagement und Veran...
VDI Wissensforum GmbH in Düsseldorf
Teile diesen Artikel
Felix Baumann ist seit März 2022 Redakteur bei BASIC thinking. Bereits vorher schrieb er 4 Jahre für den Online-Blog Mobilegeeks, der 2022 in BASIC thinking aufging. Nebenher arbeitet Felix in einem IT-Unternehmen und beschäftigt sich daher nicht nur beim Schreiben mit zukunftsfähigen Technologien.