中文

大型语言模型在回答重症监护医学问题上的表现

计算与语言 2025-09-25 v1

摘要

大型语言模型已在医学生水平的问题上进行了测试,但它们在重症监护医学(CCM)等专业领域的表现则较少被探索。本研究在871个CCM问题上评估了Meta-Llama 3.1模型(80亿和700亿参数版本)。Llama3.1:70B的表现比8B高出30%,平均准确率为60%。不同领域的表现存在差异,在研究领域最高(68.4%),在肾脏病学领域最低(47.9%),这突显了未来需要开展更广泛的工作,以改进模型在各个亚专业领域的表现。

关键词

引用

@article{arxiv.2509.19344,
  title  = {Performance of Large Language Models in Answering Critical Care Medicine Questions},
  author = {Mahmoud Alwakeel and Aditya Nagori and An-Kwok Ian Wong and Neal Chaisson and Vijay Krishnamoorthy and Rishikesan Kamaleswaran},
  journal= {arXiv preprint arXiv:2509.19344},
  year   = {2025}
}