中文

探索大语言模型在专科级肿瘤诊疗中的应用

人机交互 2024-11-07 v1 计算与语言

摘要

大语言模型(LLM)在编码临床知识和以适当临床推理回应复杂医学问题方面展现出显著进展。然而,其在亚专科或复杂医疗环境中的适用性仍有待探索。在本研究中,我们在未对该挑战性领域进行特定微调的情况下,探查了研究型对话诊断AI系统AMIE在乳腺肿瘤学亚专科领域的性能。为进行此评估,我们整理了50个合成乳腺癌病例,涵盖一系列初治与难治性病例,并反映了多学科肿瘤委员会决策时可获得的关键信息(随本工作公开发布)。我们制定了详细的临床评分标准来评估管理方案,包括病例总结质量、拟议诊疗方案的安全性以及化疗、放疗、手术和内分泌治疗建议等维度。为提升性能,我们为AMIE增强了在推理时执行网络搜索检索的能力,以获取相关且最新的临床知识,并通过多阶段自我批评流程优化其回答。我们在自动化和专科临床医生评估下,将AMIE的回答质量与内科住院医师、肿瘤学专科医师及普通肿瘤主治医师进行了比较。在评估中,AMIE的表现优于住院医师和专科医师,展示了该系统在这一极具挑战且重要领域的潜力。我们进一步通过定性示例展示了诸如AMIE的系统如何促进对话式交互以辅助临床医生决策。然而,AMIE的整体表现仍逊于肿瘤主治医师,表明在考虑前瞻性应用之前仍需进一步研究。

关键词

引用

@article{arxiv.2411.03395,
  title  = {Exploring Large Language Models for Specialist-level Oncology Care},
  author = {Anil Palepu and Vikram Dhillon and Polly Niravath and Wei-Hung Weng and Preethi Prasad and Khaled Saab and Ryutaro Tanno and Yong Cheng and Hanh Mai and Ethan Burns and Zainub Ajmal and Kavita Kulkarni and Philip Mansfield and Dale Webster and Joelle Barral and Juraj Gottweis and Mike Schaekermann and S. Sara Mahdavi and Vivek Natarajan and Alan Karthikesalingam and Tao Tu},
  journal= {arXiv preprint arXiv:2411.03395},
  year   = {2024}
}