中文

VeriSim:用于评估医疗AI在真实患者噪声下的框架

人工智能 2026-04-14 v1

摘要

医学大型语言模型(LLM)在标准化基准测试上取得了令人印象深刻的性能,但这些评估未能捕捉患者存在记忆缺口、健康素养有限、焦虑等沟通障碍等真实临床情景的复杂性。我们引入VeriSim,一个保持事实忠实的患者模拟框架,通过可控且以临床证据为依据的噪声注入到患者响应中,同时通过混合UMLS-LLM验证机制严格遵循医学事实。我们的框架基于同行评审的医学沟通文献中的六个噪声维度进行操作化,捕捉患者记忆局限、健康素养障碍和基于污名的不披露等真实临床现象。针对七个开源大型语言模型进行实验,结果显示所有模型在面对真实患者噪声时性能显著下降,诊断准确率下降15-25%,对话长度增加34-55%。值得注意的是,较小的模型(7B)相对于较大的模型(70B+) degradation 高达40%,而针对标准语料库的医学微调对抗患者沟通噪声的鲁棒性提供的帮助有限。经认证的临床医生评估表明,模拟质量高,模拟结果之间的一致性强(kappa > 0.80),而LLM作为裁判器作为可扩展评估的辅助工具实现了相当可靠的可靠性。我们的结果凸显了当前医疗AI中存在的关键模拟-现实鸿沟。我们将VeriSim发布为开源噪声注入框架,为评估临床鲁棒性提供严谨的测试平台。

关键词

引用

@article{arxiv.2604.10441,
  title  = {VeriSim: A Configurable Framework for Evaluating Medical AI Under Realistic Patient Noise},
  author = {Sina Mansouri and Mohit Marvania and Vibhavari Ashok Shihorkar and Han Ngoc Tran and Kazhal Shafiei and Mehrdad Fazli and Yikuan Li and Ziwei Zhu},
  journal= {arXiv preprint arXiv:2604.10441},
  year   = {2026}
}