中文

医学任务中的大语言模型基准评测

计算与语言 2025-11-13 v3 人工智能

摘要

随着大语言模型(LLMs)在医学领域的应用日益广泛,利用基准数据集评估这些模型的性能变得至关重要。本文对医学 LLM 任务中采用的各种基准数据集进行了全面综述。这些数据集涵盖文本、图像和多模态等多种模态,重点关注医学知识的不同方面,如电子健康记录(EHRs)、医患对话、医学问答和医学图像描述。本综述按模态对数据集进行分类,讨论了它们的重要性、数据结构以及对用于诊断、报告生成和预测性决策支持等临床任务的 LLM 发展的影响。关键的基准包括 MIMIC-III、MIMIC-IV、BioASQ、PubMedQA 和 CheXpert,它们推动了医学报告生成、临床摘要和合成数据生成等任务的进展。本文总结了利用这些基准推进多模态医学智能的挑战与机遇,强调了对具有更高语言多样性、结构化组学数据和创新合成方法的数据集的需求。这项工作也为未来 LLM 在医学中的应用研究奠定了基础,为不断发展的医学人工智能领域做出了贡献。

关键词

引用

@article{arxiv.2410.21348,
  title  = {Large Language Model Benchmarks in Medical Tasks},
  author = {Lawrence K. Q. Yan and Qian Niu and Ming Li and Yichao Zhang and Caitlyn Heqi Yin and Cheng Fei and Benji Peng and Ziqian Bi and Pohsun Feng and Keyu Chen and Tianyang Wang and Yunze Wang and Silin Chen and Ming Liu and Junyu Liu and Xinyuan Song and Riyang Bao and Zekun Jiang and Ziyuan Qin},
  journal= {arXiv preprint arXiv:2410.21348},
  year   = {2025}
}

备注

25 pages, 5 tables