中文

PediaBench:用于评估大语言模型的综合中文儿童医学数据集

计算机视觉与模式识别 2024-12-19 v2

摘要

大型语言模型(LLM)在医学领域的出现加剧了对标准数据集以评估其问答(QA)性能的迫切需求。虽然已有多个医学 QA 基准数据集,但它们要么覆盖不同科室的常识,要么针对某个特定科室(而非儿科)设计。此外,一些数据集仅限于客观问题,无法衡量 LLM 的生成能力。因此,它们不能全面评估 LLM 在儿科的 QA 能力。为填补这一空白,我们构建 PediaBench,即首个用于 LLM 评估的中文儿科数据集。具体而言,它包含 4,117 个客观问题和 1,632 个主观问题,涵盖 12 个儿科疾病组别。它采用基于不同难度级别的综合评分标准,全面评估 LLM 在指令遵循、知识理解、临床病例分析等方面的能力。最后,我们通过对 20 个开源和商业 LLM 的大量实验验证了 PediaBench 的有效性。通过对实验结果的深入分析,我们为 LLM 在中文语境下回答儿科问题的能力提供了见解,突显其在进一步改进方面的局限性。我们的代码和数据已发布于 https://github.com/ACMISLab/PediaBench。

关键词

引用

@article{arxiv.2412.06286,
  title  = {No Annotations for Object Detection in Art through Stable Diffusion},
  author = {Patrick Ramos and Nicolas Gonthier and Selina Khan and Yuta Nakashima and Noa Garcia},
  journal= {arXiv preprint arXiv:2412.06286},
  year   = {2024}
}

备注

8 pages, 6 figures, to be published in WACV 2025