中文

面向专家级医学问答的大语言模型

计算与语言 2023-05-17 v1 人工智能 机器学习

摘要

近期人工智能(AI)系统在从围棋到蛋白质折叠的“重大挑战”中已达到里程碑。检索医学知识、对其进行推理并像医师一样回答医学问题的能力长期被视为此类重大挑战之一。大语言模型(LLMs)已催化医学问答的显著进展;Med-PaLM 是首个在 US Medical Licensing Examination (USMLE) 风格问题上超过“及格”分数的模型,在 MedQA 数据集上取得 67.2% 的分数。然而,该工作及其他先前工作表明仍有显著改进空间,尤其是当模型答案与临床医师答案比较时。在此我们提出 Med-PaLM 2,其通过结合基础 LLM 改进(PaLM 2)、医学领域微调以及包含新颖集成精炼方法的提示策略来弥合这些差距。Med-PaLM 2 在 MedQA 数据集上得分高达 86.5%,较 Med-PaLM 提升超 19% 并创下新的 state-of-the-art。我们亦观察到在 MedMCQA、PubMedQA 与 MMLU 临床主题数据集上接近或超越 state-of-the-art 的性能。我们对长形式问题沿临床应用相关的多个维度进行了详细人工评估。在 1066 个消费者医学问题的成对比较排序中,医师在九个临床效用相关轴中的八个上偏好 Med-PaLM 2 的答案而非医师生成的答案(p < 0.001)。我们亦观察到在新引入的 240 个长形式“对抗性”问题(用于探查 LLM 局限)数据集上,相较 Med-PaLM 在每个评估轴均有显著提升(p < 0.001)。尽管仍需进一步研究以验证这些模型在真实世界环境中的效能,这些结果凸显了向医师级医学问答性能的快速进展。

关键词

引用

@article{arxiv.2305.09617,
  title  = {Towards Expert-Level Medical Question Answering with Large Language Models},
  author = {Karan Singhal and Tao Tu and Juraj Gottweis and Rory Sayres and Ellery Wulczyn and Le Hou and Kevin Clark and Stephen Pfohl and Heather Cole-Lewis and Darlene Neal and Mike Schaekermann and Amy Wang and Mohamed Amin and Sami Lachgar and Philip Mansfield and Sushant Prakash and Bradley Green and Ewa Dominowska and Blaise Aguera y Arcas and Nenad Tomasev and Yun Liu and Renee Wong and Christopher Semturs and S. Sara Mahdavi and Joelle Barral and Dale Webster and Greg S. Corrado and Yossi Matias and Shekoofeh Azizi and Alan Karthikesalingam and Vivek Natarajan},
  journal= {arXiv preprint arXiv:2305.09617},
  year   = {2023}
}