MedKGEval:基于医学知识图谱的开放式患者互动临床 LLM 多回合评估框架
人工智能
2025-10-15 v1
摘要
大型语言模型(LLM)在医学应用中的可靠评估仍是一个开放性挑战,尤其是捕捉真实临床环境中展开的多轮医生-患者互动的复杂性。现有的评估方法通常依赖对完整对话记录的事后审查,从而忽略了医学对话中动态的、情境依赖的特性以及患者信息需求的演变。在本工作中,我们提出了 MedKGEval,一个基于结构化医学知识的临床 LLM 多回合评估框架。我们的方法引入了三个关键贡献:(1)构建知识图谱驱动的患者模拟机制,其中专用的控制模块从精选的知识图谱中检索相关医学事实,为患者代理赋予类人且真实的对话行为。该知识图谱通过整合开源资源和从专家标注数据集中提取的额外三元组构建而成;(2)建立基于知识图谱的患者模拟机制,其中专用的控制模块从精选的知识图谱中检索相关医学事实,为患者代理赋予类人且真实的对话行为。该知识图谱通过整合开源资源和从专家标注数据集中提取的额外三元组构建而成;(3)构建了包含八个最先进 LLM 的全面多回合基准,证明了 MedKGEval 能够识别常规评估管道常常忽视的细微行为缺陷和安全风险。虽然最初为中文和英文医学应用而设计,但我们的框架可以通过切换输入知识图谱来轻松扩展到其他语言,确保无缝的双语支持和领域特定的适用性。
引用
@article{arxiv.2510.12224,
title = {MedKGEval: A Knowledge Graph-Based Multi-Turn Evaluation Framework for Open-Ended Patient Interactions with Clinical LLMs},
author = {Yuechun Yu and Han Ying and Haoan Jin and Wenjian Jiang and Dong Xian and Binghao Wang and Zhou Yang and Mengyue Wu},
journal= {arXiv preprint arXiv:2510.12224},
year = {2025}
}