LLM-Mini-CEX:面向诊断对话的大语言模型自动评估
计算与语言
2023-08-16 v1 人工智能
摘要
开发用于医学诊断的 LLMs 以提升诊断效率正引起日益增长的关注。尽管具有诱人的技术潜力,目前仍缺乏统一且全面的评估标准,导致无法评估医学 LLMs 的质量与潜在风险,进一步阻碍了 LLMs 在医疗场景中的应用。此外,当前的评估严重依赖与 LLMs 耗费人力的交互以获取诊断对话,并对诊断对话质量进行人工评估。为应对缺乏统一全面评估标准的问题,我们基于原始 Mini-CEX 首次建立了一种称为 LLM 专用 Mini-CEX 的评估标准,以有效评估 LLMs 的诊断能力。为解决交互耗费人力的问题,我们开发了患者模拟器与 LLMs 进行自动对话,并利用 ChatGPT 自动评估诊断对话。实验结果表明,LLM 专用 Mini-CEX 对于评估医学诊断对话是充分且必要的。此外,ChatGPT 可替代在人文素养指标上的人工评估,并提供不同 LLMs 之间可复现的自动化比较。
引用
@article{arxiv.2308.07635,
title = {LLM-Mini-CEX: Automatic Evaluation of Large Language Model for Diagnostic Conversation},
author = {Xiaoming Shi and Jie Xu and Jinru Ding and Jiali Pang and Sichen Liu and Shuqing Luo and Xingwei Peng and Lu Lu and Haihong Yang and Mingtao Hu and Tong Ruan and Shaoting Zhang},
journal= {arXiv preprint arXiv:2308.07635},
year = {2023}
}