大型语言模型在回答重症监护医学问题上的表现
计算与语言
2025-09-25 v1
摘要
大型语言模型已在医学生水平的问题上进行了测试,但它们在重症监护医学(CCM)等专业领域的表现则较少被探索。本研究在871个CCM问题上评估了Meta-Llama 3.1模型(80亿和700亿参数版本)。Llama3.1:70B的表现比8B高出30%,平均准确率为60%。不同领域的表现存在差异,在研究领域最高(68.4%),在肾脏病学领域最低(47.9%),这突显了未来需要开展更广泛的工作,以改进模型在各个亚专业领域的表现。
引用
@article{arxiv.2509.19344,
title = {Performance of Large Language Models in Answering Critical Care Medicine Questions},
author = {Mahmoud Alwakeel and Aditya Nagori and An-Kwok Ian Wong and Neal Chaisson and Vijay Krishnamoorthy and Rishikesan Kamaleswaran},
journal= {arXiv preprint arXiv:2509.19344},
year = {2025}
}