中文

ExplainCPE: 面向中国药师考试的自由文本解释基准

计算与语言 2023-10-27 v2

摘要

随着 ChatGPT 和 GPT-4 引领大语言模型(LLMs)的发展,越来越多的研究者正在考察它们在各类任务上的表现。但关于 LLM 可解释性能力(即在给出答案后生成理由的能力)的研究仍需加强。现有的解释数据集多为英文通用知识问答,导致主题与语言多样性不足。为解决生成理由问答数据集中的语言偏差和医疗资源缺失问题,我们提出了 ExplainCPE(超过 7k 条样本),一个简体中文下的具有挑战性的医学基准。我们分析了 ChatGPT 与 GPT-4 的错误,指出了当前 LLM 在文本理解与计算推理上的局限。实验中我们还发现不同 LLM 对上下文学习有不同偏好。ExplainCPE 提出了重大挑战,但其进一步研究的潜力令人期待,并可用于评估模型生成解释的能力。AI 安全与可信赖性需更多关注,本工作迈出了探索 LLM 医学可解释性的第一步。数据集见 https://github.com/HITsz-TMG/ExplainCPE。

关键词

引用

@article{arxiv.2305.12945,
  title  = {ExplainCPE: A Free-text Explanation Benchmark of Chinese Pharmacist Examination},
  author = {Dongfang Li and Jindi Yu and Baotian Hu and Zhenran Xu and Min Zhang},
  journal= {arXiv preprint arXiv:2305.12945},
  year   = {2023}
}

备注

EMNLP 2023 Findings