面向医学多模态大语言模型的外显临床意图理解基准测试
计算机视觉与模式识别
2026-01-13 v1 人工智能
计算与语言
摘要
医学多模态大语言模型(Med-MLLMs)需要具备外显临床意图理解能力才能实现实际部署,但现有基准测试未能评估这一关键能力。为此,我们引入MedGaze-Bench,首个将临床医师视线作为认知光标(Cognitive Cursor)来评估医疗场景中意图理解的基准测试,涵盖手术、急诊模拟及诊断解读。基准测试针对三个根本性挑战展开:解剖结构的视觉同质性、临床工作流程中的严格时序因果依赖关系,以及隐式遵循安全协议的要求。我们提出了三维临床意图框架(Three-Dimensional Clinical Intent Framework),评估:(1)空间意图(Spatial Intent)——在视觉噪声中辨别精确目标;(2)时序意图(Temporal Intent)——通过回溯与前瞻推理推断因果逻辑;(3)标准意图(Standard Intent)——通过安全检查验证协议遵循。除准确率指标外,我们引入陷阱问答(Trap QA)机制,通过惩罚幻觉和认知迎合现象来检验临床可靠性。实验结果表明,当前MLLM在外显意图理解方面存在挑战,因过度依赖全局特征,导致虚构观察和对无效指令的盲目接受。
引用
@article{arxiv.2601.06750,
title = {Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models},
author = {Shaonan Liu and Guo Yu and Xiaoling Luo and Shiyi Zheng and Wenting Chen and Jie Liu and Linlin Shen},
journal= {arXiv preprint arXiv:2601.06750},
year = {2026}
}
备注
16 pages, 4 figures