DIGITAL UPDATE (09/2026): Hilft ein Chatbot bei Gesundheitsfragen wirklich weiter?

DIGITAL UPDATE (09/2026): Hilft ein Chatbot bei Gesundheitsfragen wirklich weiter?

Millionen Menschen fragen mittlerweile Chatbots wie ChatGPT um Rat, wenn gesundheitliche Beschwerden auftreten. Ein Forschungsteam der University of Oxford hat nun in einer aufwendigen Studie mit über 1.000 Teilnehmenden untersucht, wie verlässlich diese Unterstützung im Alltag tatsächlich ist – mit einem deutlichen Ergebnis.

Wie die Studie aufgebaut war

Drei Ärztinnen und Ärzte entwickelten zehn medizinische Szenarien, etwa plötzliche starke Kopfschmerzen oder anhaltende Bauchschmerzen. Für jedes Szenario einigte sich das Ärzteteam vorab einstimmig, welche Versorgungsebene angemessen wäre, von der eigenständigen Behandlung zu Hause bis zum Rettungsdienst. 1.298 Erwachsene aus Großbritannien wurden per Zufall in vier Gruppen eingeteilt. Drei Gruppen durften sich beim Einschätzen des jeweiligen Szenarios von einem Sprachmodell unterstützen lassen (GPT-4o, das Modell hinter ChatGPT, sowie Llama 3 und Command R+). Die vierte Gruppe, die Kontrollgruppe, nutzte wie gewohnt eigene Mittel, meist eine Internetsuche. Alle Teilnehmenden sollten am Ende angeben, welche Versorgungsebene sie für richtig halten und welche möglichen Erkrankungen sie dabei in Betracht gezogen haben.

Wann die Sprachmodelle überzeugten

In einem ersten Test gaben die Forschenden den Modellen die zehn Szenarien zur Verfügung und erhoben pro Modell und Szenario jeweils 60 Antworten. Die Modelle mussten sich die Informationen hier also nicht erst in einem Gespräch erfragen. In diesem Test schnitten sie stark ab: Sie nannten in bis zu 99 % der Fälle mindestens eine relevante Erkrankung und wählten in rund der Hälfte bis knapp zwei Drittel der Fälle die richtige Vorgehensweise. Anders sah es aus, als echte Teilnehmende ihre Beschwerden in eigenen Worten schilderten und sich dabei von den Chatbots beraten ließen. In diesen Gesprächen identifizierten die Teilnehmenden in weniger als 35 % der Fälle eine relevante Erkrankung, bei der richtigen Versorgungsebene lag die Trefferquote unter 44 %. Beides war nicht besser als bei der Kontrollgruppe, die stattdessen recherchierte oder eigenes Wissen nutzte. Bei der Erkennung relevanter Erkrankungen schnitt die Kontrollgruppe sogar deutlich besser ab als die Chatbot-Nutzenden.

Gegensätzliche Empfehlungen und Kommunikationsprobleme

Die Forschenden werteten dazu auch einzelne Gesprächsverläufe aus. Ein zentrales Problem: Viele Teilnehmende schilderten ihre Beschwerden zunächst nur unvollständig, sodass wichtige Hinweise fehlten. Die Sprachmodelle reagierten zudem teils inkonsistent auf ähnliche Angaben: Zwei Personen mit nahezu identischen Symptomen einer möglichen Hirnblutung (Subarachnoidalblutung) erhielten gegensätzliche Empfehlungen, der einen wurde geraten, sich auszuruhen, der anderen, sofort den Rettungsdienst zu rufen. Und selbst wenn ein Modell die richtige Erkrankung nannte, übernahmen die Teilnehmenden diesen Hinweis in ihrer Antwort häufig nicht.

Warum gute Prüfungsergebnisse nichts über die Praxistauglichkeit aussagen

Auch gängige Testverfahren für Sprachmodelle konnten diese Schwierigkeiten nicht vorhersagen: In klassischen medizinischen Wissenstests schnitten die Modelle deutlich besser ab, als es ihre tatsächliche Hilfe für die Teilnehmenden vermuten ließ. Bei simulierten Testgesprächen, in denen ein weiteres Sprachmodell die Rolle der ratsuchenden Person übernahm, erzielten die Modelle ebenfalls wesentlich bessere Ergebnisse, als im Austausch mit echten Teilnehmenden. Überzeugende Ergebnisse in Testsituationen reichen demnach nicht aus, damit ein Chatbot Menschen im Alltag zuverlässig unterstützen kann.

So weit reicht die Studie

Die Untersuchung bezieht sich auf allgemeine Alltagsbeschwerden einer britischen Stichprobe, und die Gespräche fanden in einer nachgestellten Situation ohne echten Ernstfall statt. Die Datenerhebung fand 2024 statt, die getesteten Modelle stammen also ebenfalls aus diesem Jahr. Die grundsätzliche Erkenntnis, dass Fachwissen allein nicht ausreicht, dürfte davon aber unberührt bleiben.

Tipp für die Praxis: Gerade bei Fragen rund um Demenz lohnt sich ein Blick auf geprüfte, verständliche Informationsquellen statt auf die potenziell lückenhafte Antwort eines Chatbots. Mit der Demenzbibliothek bietet digiDEM Bayern ein wissenschaftlich abgesichertes Wissensportal rund um das Thema Demenz. Bei akuten oder unklaren Beschwerden gilt: Wenden Sie sich direkt an eine Ärztin, einen Arzt oder den Rettungsdienst.

Hier geht’s zur Studie: Reliability of LLMs as medical assistants for the general public: a randomized preregistered study

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Zum Inhalt springen