Bu sayfa, 26. Dünya Psikiyatri Kongresi'nde sunulan çalışmanın yapay zekâ desteğiyle hazırlanmış Türkçe özetidir. Çalışmanın sahibi sunan yazarlardır; atıf için orijinal kaynağa başvurun.

SO140

Kısa Sözlü Poster SunumuDijital Psikiyatri ve Yapay ZekâDerleme (sistematik olmayan)

Geriatrik psikiyatrik değerlendirmede büyük dil modellerinin sistemik başarısızlık biçimleri

SYSTEMIC FAILURE MODES OF LARGE LANGUAGE MODELS IN GERIATRIC PSYCHIATRIC ASSESSMENT: A SCOPING REVIEW

Sunan: Yun-Ting Lee

Ülke: Taiwan

Kurum: Cathay General Hospital

Oturum: 2830 - PARALLEL SHORT ORAL POSTER SESSIONS: DIGITAL & AI PSYCHIATRY - Part II

Tarih: Thu, 24.09.2026

Büyük dil modelleri (large language models, LLM) geriatrik psikiyatrik değerlendirmede beş ayrı alanda yinelenen başarısızlıklar göstermekte ve otonom kullanım için yeterli görünmemektedir.

Çalışmanın amacı, yaşlıda psikiyatrik değerlendirme sırasında büyük dil modellerine ilişkin beş aday endişe alanını haritalamak ve her birini kanıta uygun koruyucu önlemlerle eşleştirmektir. Posterde yöntem, sistematik arama ya da meta-analiz içermeyen kanıta dayalı bir bakış (evidence-informed perspective) olarak tanımlanmış; kaynaklar Mayıs 2026'ya kadar seçilmiş, güncellik Ağustos 2026'da yeniden denetlenmiş ve kanıtlar doğrudan (yaşlı erişkin), komşu ve dolaylı olarak derecelendirilmiştir. Birinci alanda uzun bağlam ve tanısal kararsızlık ele alınmış, dar tanımlı deliryum için AUROC 0,824 ve uyum katsayısı c = 0,74-0,76 bildirilmiş, doğrulanmış bir 3D (deliryum-demans-depresyon) testinin bulunmadığı belirtilmiştir. İkinci alanda uydurulmuş öncüller ve güvenilmez gerekçelendirme incelenmiş; çekişmeli (adversarial) koşulda halüsinasyon oranı %65,9'dan %44,2'ye inmiş, doğru görüntü yanıtlarının %35,5'inde gerekçelendirme hatalı bulunmuştur. Üçüncü alanda çok kipli zamansal atlama için çekişmeli VideoLLM koşullarının çoğunda %90'ın üzerinde atlama, dördüncü alanda ilaç azaltmada (deprescribing) pozitif kestirim değeri (positive predictive value, PPV) ölçüt temelli değerlendirmede 0,83 iken olgu önerisinde 0,47, GPT-4 ile MedCalc doğruluğu %50,91 olarak verilmiştir. Beşinci alanda değer örüntülerinin sıklıkla daha genç yaşa kaydığı, ancak tektip artmış klinik yaş ayrımcılığının kanıtlanmadığı ve bulguların karışık olduğu belirtilmiş; ayrıca hatalı LLM önerisi hatasız öneriyle karşılaştırıldığında düzeltilmiş tanısal doğruluğun 14,0 yüzde puanı düştüğü (otomasyon yanlılığı) vurgulanmıştır. Sonuç olarak taslak yazımı, veri çıkarımı, zaman çizelgesi ve kontrol listesi gibi kaynağı görünür ve doğrulanmış işlevler yakın vadede makul, ilaç ve hesaplama desteği yalnız belirlenimci ve doğrulanmış araçlarla koşullu kabul edilmiş; otonom tanı, tedavi, kapasite değerlendirmesi ve acil yönlendirme desteklenmemiştir. Her endişe alanı için zaman damgalı erişim, iddia düzeyinde kaynak izlenebilirliği, çekimserlik, klinisyen ya da eczacı onayı ve yaşlı ile bakım verenin birlikte değerlendirmesi gibi eşleştirilmiş koruyucu önlemler önerilmiştir.

Orijinal postere git

Bu çalışmaya nasıl atıf yapılır?

APA 7: Lee, Y-T., et al. (2026, September 24). Systemic failure modes of large language models in geriatric psychiatric assessment: a scoping review [Poster presentation]. 26th WPA World Congress of Psychiatry (WCP 2026), Stockholm, Sweden. https://cslide.ctimeetingtech.com/wcp26/attendee/eposter/file/534

Vancouver: Lee YT, et al. Systemic failure modes of large language models in geriatric psychiatric assessment: a scoping review [poster]. 26th WPA World Congress of Psychiatry (WCP 2026); 2026 Sep 23-26; Stockholm, Sweden. Available from: https://cslide.ctimeetingtech.com/wcp26/attendee/eposter/file/534

Yazar adları ve başlık biçimi kongre sisteminden otomatik oluşturulmuştur; kullanmadan önce orijinal posterle karşılaştırın.

Tüm WCP 2026 özetleri