DischargeSim:面向出院时教育性医患沟通的仿真基准
计算与语言
2025-09-22 v3 人工智能
摘要
出院沟通是患者护理中一个关键却尚未被充分探索的环节,其目标从诊断转向了教育。尽管近期的大语言模型(LLM)基准强调就诊期间的诊断推理,但它们未能评估模型在就诊后支持患者的能力。我们引入了 DischargeSim,这是一个新颖的基准,用于评估 LLM 充当个性化出院教育者的能力。DischargeSim 模拟了由 LLM 驱动的 DoctorAgent 与具有多样化社会心理特征(例如,健康素养、教育程度、情绪)的 PatientAgent 之间的就诊后多轮对话。交互跨越六个具有临床依据的出院主题进行组织,并从三个维度进行评估:(1)通过自动评估和 LLM-as-judge 评估衡量对话质量;(2)个性化文档生成,包括自由文本摘要和结构化 AHRQ 清单;(3)通过下游多项选择题考试衡量患者理解程度。跨越 18 个 LLM 的实验揭示了出院教育能力方面的显著差距,且不同患者特征下的表现差异很大。值得注意的是,模型规模并不总能带来更好的教育结果,这凸显了策略使用与内容优先级方面的权衡。DischargeSim 为在就诊后临床教育中对 LLM 进行基准测试以及促进公平、个性化的患者支持迈出了第一步。
引用
@article{arxiv.2509.07188,
title = {DischargeSim: A Simulation Benchmark for Educational Doctor-Patient Communication at Discharge},
author = {Zonghai Yao and Michael Sun and Won Seok Jang and Sunjae Kwon and Soie Kwon and Hong Yu},
journal= {arXiv preprint arXiv:2509.07188},
year = {2025}
}
备注
Equal contribution for the first two authors. To appear in the proceedings of the Main Conference on Empirical Methods in Natural Language Processing (EMNLP) 2025