KI scheitert an einfacher Logikfrage

Das Thema Künstliche Intelligenz hat seit dem Erfolg von ChatGPT enorm an Fahrt aufgenommen. Doch die allwissend erscheinenden KI-Systeme scheitern bereits an dieser einfachen Logikfrage. Hättest du sie beantworten können?

Die Entwicklungen im Bereich der Künstlichen Intelligenz schreiten in rasantem Tempo voran. Seit dem erfolgreichen Start von ChatGPT haben KI-Systeme immer mehr an Bedeutung gewonnen.

Doch sind die großen Sprachmodelle tatsächlich so schlau, wie sie immer dargestellt werden? Eine neue Studie der KI-Forschungsorganisation Laion hat nun aber gezeigt, dass KI auch an einer einfachen Logikfrage scheitern kann.

Die Forschenden haben für ihre Untersuchung ein „konventionelles Problem des gesunden Menschenverstands“ verwendet. Damit haben sie die Fähigkeiten großer Sprachmodelle wie GPT-3.5/4, Gemini oder LLaMa 2/3 getestet.

Allerdings kommen sie dabei zu einem überraschenden Ergebnis. Denn fast alle großen KI-Sprachmodelle sind an der Logikfrage der Forscher:innen gescheitert.

Wir demonstrieren hier einen dramatischen Zusammenbruch der Funktions- und Denkfähigkeiten modernster Modelle, die auf den größten verfügbaren Skalen trainiert wurden und eine starke Funktion beanspruchen.

Dabei haben die Forschenden nicht versucht, die KI-Systeme auszutricksen. Denn Logikfrage war „in prägnanter natürlicher Sprache formuliert“ und kann „von Menschen leicht gelöst werden“.

„Der Zusammenbruch ist dramatisch, da die Modelle auch starkes Selbstvertrauen in ihre falschen Lösungen zeigen“, schreiben die Forscher:innen in ihrer Zusammenfassung. Auch mit Aufforderungen an die Modelle, die falschen Lösungen durch eine mehrstufige Neubewertung noch einmal zu überdenken, haben nicht zur richtigen Beantwortung der Frage geführt.

Hättest du diese Frage beantworten können?

Die Forschenden haben sich für ihre Untersuchung dem „Alice im Wunderland“-Problem zugewandt. Dabei musste die jeweilige KI eine einfache Logikfrage beantworten, die auf der folgenden Problemformulierung basiert.

Alice hat N Brüder und sie hat auch M Schwestern. Wie viele Schwestern hat der Bruder von Alice?

Für ihre Untersuchung haben die Forschenden verschiedene Versionen genutzt, also für N und M verschiedene Zahlen eingesetzt. Lautet der Satz also beispielsweise: „Alice hat 3 Brüder und sie hat auch 2 Schwestern.“ Dann wäre die Antwort auf die Frage „Wie viele Schwestern hat der Bruder von Alice?“ in diesem Fall drei, da Alice ja auch eine Schwester ihrer Brüder ist.

Zu den befragten KI-Modellen zählten unter andere, OpenAIs GPT-3, GPT-4 und GPT-4o sowie Googles Gemini und Metas Llama-Modelle. Doch laut den Ergebnissen der Untersuchung hatten alle KI-Modelle Probleme mit der Lösung der Logikfrage. Teilweise beharrten sie nach mehrmaligen Nachfragen sogar auf ihren falschen Lösungen.

Allein das neue GPT-4o von OpenAI konnte mit einer Erfolgsrate von 65 Prozent aus der Masse herausstechen. Claude 3 Opus hatte hingegen nur 43 Prozent der Fragen richtig, Gemini Pro von Google kommt hingegen nur in 0,8 Prozent der Fälle auf die richtige Lösung.

Forschende werfen Fragen über Fähigkeiten von KI-Modellen auf

Die Forscher:innen von Laion fordern nach diesen Ergebnissen ihrer Untersuchung „eine dringende Neubewertung der behaupteten Fähigkeiten“ von großen Sprachenmodellen. Dafür müsste die Branche standardisierte Benchmarks schaffen.

Nur so könnten solche „grundlegenden Argumentationsdefizite“ identifiziert werden, die bei den aktuell angewandten „Bewertungsverfahren und Benchmarks unentdeckt bleiben“.

Google lässt dich jetzt selbst bestimmen, welche Quellen du in der Suche häufiger siehst. Mit zwei schnellen Klicks kannst du BASIC thinking kostenlos als bevorzugte Quelle hinzufügen und damit unabhängigen Tech-Journalismus unterstützen. Vielen Dank!

Auch interessant:

		Social Media Marketing Manager (d/w/m) BavariaDirekt in München
		Praktikant (w/m/d) Marketing & Social Med... Bübchen Skincare GmbH in Düsseldorf
		Junior Sales Manager (m/w/d) Online Marketing Sellwerk GmbH & Co. KG in Düsseldorf, Dormagen, Duis...
		Digital Marketing Manager (m/w/d) in Vollzeit Hisense Gorenje Germany GmbH in Garching bei München
		Online Marketing Manager (m/w/d) Systemair GmbH in Boxberg-Windischbuch
		Content Creator Social Media (m/w/d) mit infl... Starkkraft engineering GmbH in Eschborn
		Projektmanager Digital / Social Media (w/m/d)... Heimrich & Hannot GmbH in Köln
		Digital Excellence Manager Oncology befristet... AstraZeneca in Hamburg

		(Senior) Sales Automation Manager:in (w/m/d) d.velop AG in Bocholt, Gescher, Meppen, Münster, Osn...
		Head of Marketing Europe – B2B / Digita... AM Logistic Solutions GmbH in Offenau
		Junior Sales Manager (m/w/d) Online Marketing Sellwerk GmbH & Co. KG in Düsseldorf, Dormagen, Duis...
		Product Manager MyLiebherr Digital Commerce &... Liebherr-International Deutschland GmbH in Biberach
		Social Media Marketing Manager (d/w/m) BavariaDirekt in München

Einfache Logikfrage lässt KI verzweifeln – kannst du sie beantworten?