中文

医学 VQA 的视觉链思考框 grounding:基于测试时训练

计算机视觉与模式识别 2025-11-18 v1

摘要

医学视觉问答可支持临床决策,但当前系统在域迁移下常常失败,生成的答案在图像证据上 grounding 较弱。这种可靠性差距源于模型注意力集中于伪影区域,以及在部署时不实际进行再训练或获取额外标签。我们提出 CoTBox-TTT,一种以证据为导向的测试时训练方法,在推理时适配视觉语言模型,同时保持所有 backbone 冻结。该方法仅更新一小部分连续软提示。它通过视觉链思考信号识别问题相关区域,并鼓励原始图像与局部裁剪之间的答案一致性。该程序无标签、即插即用,可与多样化的 backbone 配合。实验表明,该方法对医学 VQA 实用性强。例如,将 CoTBox-TTT 添加到 LLaVA 后,pathVQA 上闭合式准确率提升 12.3%。

关键词

引用

@article{arxiv.2511.12446,
  title  = {CoTBox-TTT: Grounding Medical VQA with Visual Chain-of-Thought Boxes During Test-time Training},
  author = {Jiahe Qian and Yuhao Shen and Zhangtianyi Chen and Juexiao Zhou and Peisong Wang},
  journal= {arXiv preprint arXiv:2511.12446},
  year   = {2025}
}