MedDialBench:参数化对抗性患者行为下LLM诊断鲁棒性基准测试
计算与语言
2026-04-09 v1 人工智能
摘要
交互式医学对话基准测试表明,当与非合作患者交互时,LLM诊断准确率显著下降,然而现有方法要么在不分级严重程度或案例特定锚定的情况下应用对抗行为,要么将患者不合作简化为单一未分级轴,且均未分析跨维度交互。本文引入MedDialBench,一个能够对个体患者行为维度如何影响LLM诊断鲁棒性进行受控的剂量-反应表征的基准测试。它将患者行为分解为五个维度——逻辑一致性、健康认知、表达风格、披露和态度——每个维度具有分级严重程度和案例特定的行为脚本。这种受控因子设计使得分级敏感性分析、剂量-反应分析和跨维度交互检测成为可能。在7225段对话(85个案例×17种配置×5个模型)上评估五种前沿LLM后,我们发现了一个基本不对称性:信息污染(伪造症状)产生的准确率下降幅度是信息缺失(隐瞒信息)的1.7-3.4倍,且伪造是唯一在所有五个模型中均达到统计显著性的配置(McNemar p < 0.05)。在六个维度组合中,伪造是超加性交互的唯一驱动因素:所有三个涉及伪造的配对产生的O/E比率为0.70-0.81(35-44%的符合条件案例在组合下失败,尽管在各维度单独下成功),而所有非伪造配对仅表现出纯加性效应(O/E ≈ 1.0)。询问策略调节缺失但不能抵消污染:穷尽式提问可以恢复被隐瞒的信息,但无法补偿伪造输入。模型表现出不同的脆弱性特征,最差情况下降幅范围为38.8至54.1个百分点。
引用
@article{arxiv.2604.06846,
title = {MedDialBench: Benchmarking LLM Diagnostic Robustness under Parametric Adversarial Patient Behaviors},
author = {Xiaotian Luo and Xun Jiang and Jiangcheng Wu},
journal= {arXiv preprint arXiv:2604.06846},
year = {2026}
}
备注
9 pages, 4 figures, 9 tables. Preprint