不确定性感知的医学诊断短语识别与定位
计算机视觉与模式识别
2025-08-07 v3
摘要
医学短语定位对于基于短语查询识别医学图像中的相关区域至关重要,有助于进行准确的图像分析和诊断。然而,当前的方法依赖从医学报告中手动提取关键短语,降低了效率并增加了临床医生的工作量。此外,缺乏模型置信度估计限制了临床信任和可用性。在本文中,我们引入了一项名为医学报告定位(MRG)的新任务,旨在以端到端的方式直接从医学报告中识别诊断短语及其对应的定位框。为了应对这一挑战,我们提出了 uMedGround,这是一个稳健且可靠的框架,利用多模态大语言模型通过在词汇表中嵌入一个独特的标记 <BOX> 来预测诊断短语,以增强检测能力。视觉编码器-解码器处理嵌入的标记和输入图像以生成定位框。关键的是,uMedGround 结合了不确定性感知预测模型,显著提高了定位预测的鲁棒性和可靠性。实验结果表明,uMedGround 优于最先进的医学短语定位方法和微调的大型视觉语言模型,验证了其有效性和可靠性。本研究是对 MRG 任务的先驱性探索,标志着该领域的首次尝试。此外,我们展示了 uMedGround 在医学视觉问答和基于类别的定位任务中的适用性,它突出了与关键诊断短语对齐的视觉证据,支持临床医生解释各种类型的文本输入,包括自由文本报告、视觉问答查询和类别标签。
引用
@article{arxiv.2404.06798,
title = {Uncertainty-aware Medical Diagnostic Phrase Identification and Grounding},
author = {Ke Zou and Yang Bai and Bo Liu and Yidi Chen and Zhihao Chen and Yang Zhou and Xuedong Yuan and Meng Wang and Xiaojing Shen and Xiaochun Cao and Yih Chung Tham and Huazhu Fu},
journal= {arXiv preprint arXiv:2404.06798},
year = {2025}
}
备注
17 pages, 6 figures