超越理想化患者:在医疗咨询中评估面对挑战性患者行为的大语言模型
计算与语言
2026-04-01 v1
摘要
大语言模型(LLMs)正在广泛用于医疗咨询和健康信息支持。在此高风险场景中,安全性不仅取决于医学知识,还取决于模型在患者输入不清晰、不一致或误导时如何作出回应。然而,大多数现有医学 LLM 评估假设患者提问为理想化且明确的问题,这限制了其现实性。本文研究常见于真实医疗咨询场景且 complicate safe 临床推理的挑战性患者行为。我们定义四类临床上依据的此类行为:信息矛盾、事实不准确、自我诊断和护理抵抗。针对每种行为,我们指定具体的不安全响应标准。基于四个现有医学对话数据集,我们引入 CPB-Bench(挑战性患者行为基准),这是一套包含692个多轮对话的双语(英文和中文)基准,标注了这些行为。我们评估了各种开放和封闭来源的 LLMs 对面对挑战性患者言语的响应。尽管总体表现良好,但我们识别出一贯且行为特定的失败模式,在处理矛盾或医学上不合理的患者信息方面存在特定困难。我们还研究了四种干预策略,发现其结果不一致且可能引入不必要的纠正。我们发布了数据集和代码。
引用
@article{arxiv.2603.29373,
title = {Beyond Idealized Patients: Evaluating LLMs under Challenging Patient Behaviors in Medical Consultations},
author = {Yahan Li and Xinyi Jie and Wanjia Ruan and Xubei Zhang and Huaijie Zhu and Yicheng Gao and Chaohao Du and Ruishan Liu},
journal= {arXiv preprint arXiv:2603.29373},
year = {2026}
}