MedConceal:临床隐藏关切推理基准测试集
计算与语言
2026-04-13 v1
摘要
患者-医生沟通是一个信息不对称的问题:患者往往不会披露恐惧、误解或实际障碍,除非医生能灵巧地引导他们。有效的医疗对话因此需要在部分可见性下进行推理:医生必须通过引导潜在关切、通过互动确认它们并作出应对,以引导患者获得适当的护理。然而,现有的医疗对话基准测试大多回避了这一挑战,通过暴露隐藏的患者状态、将引导简化为提取,或在不建模剩余隐藏内容的情况下评估响应。我们提出MedConceal,一个用于评估医疗对话中隐藏关切推理的基准测试,包含300个精选案例和600次医生-LLM互动。基于医生回答的线上健康讨论构建,每个案例将医生可见的上下文与来自先前文献并使用专家开发的分类法结构化的模拟器内部隐藏关切配对。模拟器会隐藏这些关切、跟踪它们是否被揭示和解决,并通过基于理论的逐轮通信信号进行评估,经医生审核后确保临床可行性。这使得能够过程感知地评估任务成功性以及导致它的互动过程。我们研究了两种能力:确认,通过多轮对话揭示隐藏关切;干预,针对主要关切并引导患者走向目标计划。结果表明,没有单一系统在所有指标上都领先:前沿模型在不同确认指标上各有优势,而人类医生(N=159)在干预成功方面仍然最强。这些结果确定了在部分可见性下进行隐藏关切推理是医疗对话系统的一个关键未解决挑战。
引用
@article{arxiv.2604.08788,
title = {MedConceal: A Benchmark for Clinical Hidden-Concern Reasoning Under Partial Observability},
author = {Yikun Han and Joey Chan and Jingyuan Chen and Mengting Ai and Simo Du and Yue Guo},
journal= {arXiv preprint arXiv:2604.08788},
year = {2026}
}