PofoliaPofolia ile paylaşıldı

PLoS ONE· 2026Q1

Yapay Zeka, NIH Hibe Özetlerinin Kodlanmasında İnsanları Geride Bıraktı

AI versus human coding of NIH grant abstracts

Sarah A. Alkhatib, Nadiya Alnoor Jiwa, Dallin Judd, Justin M. Luningham ve diğerleri

Kısa özet

ChatGPT-4.0, NIH hibe özetlerinden insan kodlayıcılardan daha yüksek kaliteli yenilik tanımları üretti; derinlik ve alaka düzeyinde sırasıyla ortalama 4.47/5'e karşı insanların 3.33/5 ve 3.24/5 puan aldı.

Yapay zekâ ile başlık ve abstract'tan üretildi; tam metin okunmaz.

Ana noktalar

  • ChatGPT-4.0 ve insan kodlayıcılar, araştırma yenilikleri için 125 NIH hibe özetini analiz etti.
  • İnsan değerlendiriciler, ChatGPT'nin yenilik tanımlarını insan tarafından üretilenlerden daha yüksek puanladı.
  • ChatGPT çıktıları, derinlik/ayrıntı için ortalama 4.47/5 ve alaka/tamlık için ortalama 4.47/5 puan aldı.
  • İnsan çıktıları, derinlik/ayrıntı için ortalama 3.33/5 ve alaka/tamlık için ortalama 3.24/5 puan aldı.

Yapay zekâ ile başlık ve abstract'tan üretildi; tam metin okunmaz.

Özet (abstract)

Large language models (LLMs) are increasingly used for qualitative analysis in substance use research, yet their performance relative to human coders remains underexplored. This study compares ChatGPT-4.0 with human coders in performing qualitative coding tasks using NIH grant abstracts as a test case, focusing on the identification and description of research innovations. Using a sample of NIH HEAL Initiative grant abstracts related to opioid overdose prevention, a total of 125 abstracts were independently coded by ChatGPT and humans to generate innovation descriptions, which were then evaluated by both human raters and ChatGPT for depth/detail and relevance/completeness using 5-point Likert scales. Identical instructions were used across all coding and evaluation stages. ChatGPT-generated descriptions were consistently rated higher than human-generated descriptions on both dimensions. Human evaluators rated ChatGPT outputs at an average of 4.47 for both depth/detail and relevance/completeness, compared to 3.33 and 3.24 for human outputs, respectively (F(1,176)=133.9, p < 0.001). These findings suggest that LLMs, when carefully prompted, can enhance the efficiency and quality of qualitative research evaluation.

Yazarların özeti; kaynağından alınmıştır. PLoS ONE, 2026 · DOI ↗

ÇıkarımlarPremium
Makaleye SorÜcretsiz hesapla

Ücretsiz hesapla devam et

Makaleye Sor ile bu makaleye günde 3 soru ücretsiz; makaleyi kaydet, kaynakçasını al, ilgi alanına göre her gün yeni özetler. Çıkarımlar Premium.

Web'de ücretsiz devam et

Google ya da Apple hesabınla giriş; kart istemez. Bu makaleye geri dönersin.

Telefonda:

Alan: Genel Sosyal Bilimler

General Social SciencesSocial Sciences