npj Digital Medicine· 2026Q1
LEME: Gelişmiş Akıl Yürütme ve Klinik Doğrulama ile Oftalmoloji için Açık Büyük Dil Modelleri
LEME: open large language models for ophthalmology with advanced reasoning and clinical validation
- 1atıf
- Q1SCImago
- 2026yıl
Kısa özet
Oftalmolojiye özel açık ağırlıklı bir YD modülleri paketi olan LEME, yedi temel modeli (GPT-4o dahil, %3,32 ROUGE-L ile) geride bırakıyor ve hasta sorgularını yanıtlama konusunda üstün klinisyen derecelendirmeleri ile klinik notlardan görsel keskinlik çıkarma konusunda daha yüksek F1 puanları elde ediyor.
Yapay zekâ ile başlık ve abstract'tan üretildi; tam metin okunmaz.
Ana noktalar
- Oftalmoloji için açık ağırlıklı bir YD modülleri paketi olan LEME, talimat ayarlaması ve pekiştirmeli öğrenme kullanılarak geliştirilmiştir.
- LEME, sıfır-çekim soru yanıtlama ve hasta-doktor konsültasyonu kıyaslamalarında yedi temel modeli (ROUGE-L'de %3,32 ile GPT-4o dahil) geride bırakmıştır.
- Klinisyenler, hasta sorgularını yanıtlama konusunda LEME'yi en yüksek derecelendirmeyle değerlendirmiş olup, eksiksizliği uzman tarafından yazılan yanıtları aşmıştır (p=0,015).
- LEME, klinik notlardan görsel keskinlik çıkarma konusunda en yüksek F1 puanlarını elde etmiş, LLaMA-3 70B'yi %14,1 ve Eye-LLaMA'yı %59,0 oranında geride bırakmıştır.
Yapay zekâ ile başlık ve abstract'tan üretildi; tam metin okunmaz.
Özet (abstract)
Large language models (LLMs) offer potential to alleviate the growing public health burden of eye disease; however, few models have been tailored for ophthalmology or evaluated against clinically relevant benchmarks and real-world workflows. Here, we present LEME, a suite of open-weight LLMs for ophthalmology developed via a two-stage framework: instruction tuning on 211,149 examples curated from authoritative sources, and reinforcement learning with 29,747 preference-labeled examples to enhance clinical reasoning and informativeness. LEME was evaluated under zero-shot settings using five curated benchmarks, covering question answering and patient-physician consultation. LEME outperformed all seven baselines (all p < 0.004), notably exceeding GPT-4o by 3.32% in average ROUGE-L. Furthermore, LEME was assessed on three downstream tasks using deidentified patient data. In answering patient queries, LEME received the highest overall ratings from attending clinicians; its completeness rating even surpassed that of the expert-written answers ( p = 0.015). For visual acuity extraction from clinical notes, LEME achieved the highest F1 scores, outperforming LLaMA-3 70B by 14.1% and Eye-LLaMA by 59.0%. Finally, in assessment and treatment plan generation, LEME achieved ratings approaching those of attending clinicians, demonstrating promise for ophthalmic decision support. All models, datasets, and code are made open to support further development and validation.
Yazarların özeti; kaynağından alınmıştır. npj Digital Medicine, 2026 · DOI ↗
Ücretsiz hesapla devam et
Makaleye Sor ile bu makaleye günde 3 soru ücretsiz; makaleyi kaydet, kaynakçasını al, ilgi alanına göre her gün yeni özetler. Çıkarımlar Premium.
Web'de ücretsiz devam etGoogle ya da Apple hesabınla giriş; kart istemez. Bu makaleye geri dönersin.
Telefonda:
Alan: Sağlık Bilişimi
Health InformaticsMedicine