KI-Unterstützung in der Psychiatrie: Was die PsychFound-Studie zeigt und was nicht
Eine Arbeit in Nature Machine Intelligence hat KI-Unterstützung nicht nur an Testfragen gemessen, sondern in der laufenden Versorgung. Die Dokumentationszeit sank, ohne dass die Qualität litt. Was sich davon auf deutsche Praxen übertragen lässt und was nicht.

Studien zu künstlicher Intelligenz in der Medizin gibt es inzwischen viele. Die meisten testen Modelle an Prüfungsfragen oder an Datensätzen, die im Labor entstanden sind. Was fast immer fehlt, ist der Schritt in die tatsächliche Versorgung: Arbeiten Behandler mit KI-Unterstützung anders, und wird das Ergebnis besser?
Eine im April 2026 in Nature Machine Intelligence erschienene Arbeit hat genau das untersucht. Sie ist auf die deutsche Psychotherapie nicht eins zu eins übertragbar, enthält aber einen Befund, der auch hier zählt.
Was untersucht wurde
Eine Forschungsgruppe aus Shanghai und Peking hat ein Sprachmodell speziell für die psychiatrische Versorgung angepasst und PsychFound genannt. Grundlage waren kuratierte psychiatrische Fachtexte sowie rund 64.600 reale elektronische Patientenakten aus chinesischen Kliniken. Mit sieben Milliarden Parametern ist das Modell vergleichsweise klein, also deutlich kompakter als die großen Allzweckmodelle.
Die Bewertung lief in drei Stufen. Zuerst standardisierte Wissenstests und Aufgabenbenchmarks im Vergleich mit 22 anderen Modellen. Dann eine prospektive Studie mit zwei Gruppen in der laufenden Versorgung. Zuletzt eine Lesestudie mit 60 Psychiatern unterschiedlicher Erfahrungsstufen, je zwanzig in Weiterbildung, zwanzig Fachärzte und zwanzig erfahrene Oberärzte.
Die Ergebnisse
In den retrospektiven Tests lag PsychFound insgesamt vorn, trotz seiner geringen Größe. Interessanter ist der prospektive Teil. Ärzte in Weiterbildung, die mit dem Modell arbeiteten, erreichten eine höhere Konsultationsqualität, eine höhere diagnostische Treffsicherheit, eine angemessenere Medikamentenauswahl und benötigten weniger Zeit für die Dokumentation. Alle vier Unterschiede waren statistisch signifikant.
In der Lesestudie entsprach die klinische Argumentation des Modells dem Niveau von Fachärzten.
Warum der prospektive Teil der eigentliche Beitrag ist
Der Unterschied zwischen einem Benchmark und einer prospektiven Studie wird regelmäßig unterschätzt. Ein Modell, das Prüfungsfragen löst, beweist damit nichts über seinen Nutzen im Behandlungszimmer. Prüfungsfragen sind sauber formuliert, haben eine richtige Antwort und stehen nicht selten bereits in den Trainingsdaten. Reale Fälle sind unvollständig, widersprüchlich und verändern sich über die Zeit.
Dass hier beides gemessen wurde, und dass sich die Zeitersparnis nicht auf Kosten der Qualität einstellte, ist das eigentlich Bemerkenswerte. Bei Dokumentationswerkzeugen ist genau das die entscheidende Frage: Wer schneller dokumentiert, aber schlechter, hat nichts gewonnen.
Was sich nicht übertragen lässt
Bevor jemand diese Ergebnisse auf die eigene Praxis überträgt, gehören vier Einschränkungen dazu.
Es geht um Psychiatrie, nicht um Psychotherapie. Untersucht wurden Diagnostik, Medikationsentscheidungen und Verlaufsmanagement in einem klinischen Setting. Die Medikamentenauswahl, einer der vier gemessenen Vorteile, ist für deutsche Psychotherapeuten ohne Belang.
Anderes Gesundheitssystem. Chinesische Klinikdokumentation folgt anderen Vorgaben als die ambulante Versorgung in Deutschland. Über Antragsverfahren, Berichte an Gutachter oder die Anforderungen der Psychotherapie-Richtlinie sagt die Arbeit nichts.
Ärzte in Weiterbildung. Der gemessene Zuwachs betrifft weniger erfahrene Behandler. Wie groß der Nutzen für jemanden mit fünfzehn Jahren Praxiserfahrung ausfällt, beantwortet die Studie nicht. Plausibel ist, dass er kleiner ausfällt.
Ein hochspezialisiertes Modell. PsychFound wurde eigens auf realen Klinikakten trainiert. Diese Daten können aus Datenschutzgründen nicht veröffentlicht werden, was die unabhängige Nachprüfbarkeit begrenzt und zugleich zeigt, wie voraussetzungsvoll solche Modelle sind.
Hinzu kommt eine Einschränkung in eigener Sache: Der Volltext steht hinter einer Bezahlschranke. Die hier wiedergegebenen Ergebnisse stammen aus der frei zugänglichen Zusammenfassung.
Was übrig bleibt
Der belastbare Kern ist schmal, aber er ist vorhanden. In einer prospektiv angelegten Untersuchung ging die Dokumentationszeit zurück, ohne dass die Qualität darunter litt. Die Richtung deckt sich mit der großen Kaiser-Permanente-Auswertung, über die wir an anderer Stelle berichtet haben, dort allerdings aus der allgemeinmedizinischen Versorgung eines US-Systems.
Zwei unabhängige Untersuchungen in völlig unterschiedlichen Gesundheitssystemen, die in dieselbe Richtung zeigen, sind mehr wert als jedes Herstellerversprechen. Ein Beweis für Ihre Praxis sind sie trotzdem nicht.
Die praktisch brauchbare Frage
Bei der Auswahl eines Dokumentationswerkzeugs lautet die nützliche Frage nicht, wie gut das zugrunde liegende Modell in Benchmarks abschneidet. Sie lautet, ob Sie am Ende weniger Zeit brauchen und ob das Ergebnis dem standhält, was Sie selbst geschrieben hätten.
Das lässt sich nur an der eigenen Dokumentation prüfen, nicht an fremden Studien. psynex können Sie kostenlos mit Ihren eigenen Sitzungen testen. Wenn das Ergebnis Ihrem fachlichen Anspruch nicht genügt, haben Sie das binnen einer Woche herausgefunden.
Sehen Sie Psynex in Aktion
In einer persönlichen Demo zeigen wir Ihnen, wie Psynex Ihre Sitzungen analysiert, ICD-10 Diagnosen vorschlägt und Symptome trackt. Individuell auf Ihre Praxis zugeschnitten.
Demo vereinbaren15 Minuten • Unverbindlich • Ihre Fragen beantwortet