中文

基于状态感知患者模拟器的大语言模型自动交互式评估

计算与语言 2024-07-23 v4

摘要

大语言模型(LLMs)在人类交互方面已展现出卓越的能力,然而其在医疗领域的应用仍探索不足。以往的工作主要侧重于通过考试评估医学知识的表现,这与真实场景相去甚远,不足以评估大语言模型在临床任务上的能力。为促进大语言模型(LLMs)在医疗保健中的应用,本文引入了自动交互式评估(AIE)框架和状态感知患者模拟器(SAPS),旨在弥合传统LLM评估与临床实践细致需求之间的差距。与依赖静态医学知识评估的先前方法不同,AIE和SAPS提供了一个动态、真实的平台,通过多轮医患模拟来评估LLM。这种方法更贴近真实的临床场景,并允许对LLM在应对复杂患者交互时的行为进行详细分析。我们广泛的实验验证证明了AIE框架的有效性,其结果与人类评估高度一致,突显了其革新医学LLM测试以改善医疗服务的潜力。

关键词

引用

@article{arxiv.2403.08495,
  title  = {Automatic Interactive Evaluation for Large Language Models with State Aware Patient Simulator},
  author = {Yusheng Liao and Yutong Meng and Yuhao Wang and Hongcheng Liu and Yanfeng Wang and Yu Wang},
  journal= {arXiv preprint arXiv:2403.08495},
  year   = {2024}
}

备注

23 pages, 5 figures