凭借精准放大诊断:基于主动缩放的信心感知超声视觉-语言问答
计算机视觉与模式识别
2026-05-26 v2 人工智能
摘要
视觉-语言模型(VLM)已显著推进了医学视觉问答,但在超声声像领域表现仍不理想。临床实践中,超声科医生会明确聚焦于病灶区域以制定报告,尽管诊断解读可能因内在主观性而产生差异。然而,现有VLM并未专门设计以在诊断前交互式放大病灶区域;此外,这些模型通常将标注视为无偏准确答案,未能考虑其内在的主观性与模糊性。本文提出一种特定于儿科声像学家认知工作流程的框架。我们首先引入结构化的“放大-诊断”范式,复制交互式搜索过程以实现病灶聚焦推理。进一步地,在群体相对策略优化(GRPO)框架内,我们引入一种不确定性感知奖励,基于随机群体式 rollout 估计预测一致性,以此作为模型置信度的代理指标。这两个组件共同鼓励模型在清晰案例中强化准确预测,在模糊情形下保持谨慎。跨肝脏、乳腺和甲状腺数据集的实验表明,我们的框架使病灶定位提升了39.3%,证明模型已学习到主动凝视并诊断的能力。
引用
@article{arxiv.2605.21652,
title = {Look-Closer-Then-Diagnose: Confidence-Aware Ultrasound VQA via Active Zooming},
author = {Yue Zhou and Erxuan Wu and Yikang Sun and Hongjoo Lee and Yuan Bi and Huixiong Xu and Nassir Navab and Zhongliang Jiang},
journal= {arXiv preprint arXiv:2605.21652},
year = {2026}
}