中文

MedGPTEval: 用于评估大语言模型医学回复的数据集与基准

计算与语言 2023-05-15 v1

摘要

方法:首先,基于全面的文献综述设计一套评估标准。其次,通过医学与工程学五名专家的德尔菲法对现有候选标准进行优化以供使用。第三,三名临床专家设计一套医学数据集以与 LLM 交互。最后,在该数据集上开展基准实验。基于 LLM 的聊天机器人生成的回复由五名持证医学专家进行盲评记录。结果:所获评估标准涵盖医学专业能力、社会综合能力、语境能力与计算鲁棒性,含十六项细化指标。医学数据集包含二十七例中文医疗对话与七份病例报告。评估了三个聊天机器人:OpenAI 的 ChatGPT、百度公司的 ERNIE Bot 与上海人工智能实验室的 Doctor PuJiang (Dr. PJ)。实验结果表明,Dr. PJ 在多轮医疗对话与病例报告两类场景中均优于 ChatGPT 与 ERNIE Bot。

关键词

引用

@article{arxiv.2305.07340,
  title  = {MedGPTEval: A Dataset and Benchmark to Evaluate Responses of Large Language Models in Medicine},
  author = {Jie Xu and Lu Lu and Sen Yang and Bilin Liang and Xinwei Peng and Jiali Pang and Jinru Ding and Xiaoming Shi and Lingrui Yang and Huan Song and Kang Li and Xin Sun and Shaoting Zhang},
  journal= {arXiv preprint arXiv:2305.07340},
  year   = {2023}
}