中文

AI Hospital:多智能体医学交互模拟器中的大语言模型基准测试

计算与语言 2024-07-01 v4

摘要

人工智能通过大语言模型(LLM)在医学问答基准测试中取得显著进展,尤其在医疗问答方面表现突出。然而,其在临床实践中的实际应用仍有限,主要受制于医生-患者交互的复杂性。为此,我们引入AI Hospital框架,构建多智能体系统模拟医生与患者、检验医生等非玩家角色(NPC)之间的动态医学交互。Doctor作为玩家角色,与包括Patient、Examiner、Chief Physician等NPC进行交互,实现对LLM在临床情景中的真实评估。我们开发了Multi-View Medical Evaluation(MVME)基准,利用高质量中文医疗记录和NPC,对LLM在症状收集、检查建议和诊断等方面的性能进行评估。此外,提出了一种争议解决协作机制,通过迭代讨论提高诊断准确性。尽管取得了改进,当前LLM在多轮交互方面的表现仍显著落后于单步骤方法。我们的发现表明,需要进一步研究以弥合这些差距,提高LLM的临床诊断能力。我们的数据、代码和实验结果均已开源于\url{https://github.com/LibertFan/AI_Hospital}。

关键词

引用

@article{arxiv.2402.09742,
  title  = {AI Hospital: Benchmarking Large Language Models in a Multi-agent Medical Interaction Simulator},
  author = {Zhihao Fan and Jialong Tang and Wei Chen and Siyuan Wang and Zhongyu Wei and Jun Xi and Fei Huang and Jingren Zhou},
  journal= {arXiv preprint arXiv:2402.09742},
  year   = {2024}
}

备注

https://github.com/LibertFan/AI_Hospital