医学 VQA 的视觉链思考框 grounding:基于测试时训练
计算机视觉与模式识别
2025-11-18 v1
摘要
医学视觉问答可支持临床决策,但当前系统在域迁移下常常失败,生成的答案在图像证据上 grounding 较弱。这种可靠性差距源于模型注意力集中于伪影区域,以及在部署时不实际进行再训练或获取额外标签。我们提出 CoTBox-TTT,一种以证据为导向的测试时训练方法,在推理时适配视觉语言模型,同时保持所有 backbone 冻结。该方法仅更新一小部分连续软提示。它通过视觉链思考信号识别问题相关区域,并鼓励原始图像与局部裁剪之间的答案一致性。该程序无标签、即插即用,可与多样化的 backbone 配合。实验表明,该方法对医学 VQA 实用性强。例如,将 CoTBox-TTT 添加到 LLaVA 后,pathVQA 上闭合式准确率提升 12.3%。
关键词
引用
@article{arxiv.2511.12446,
title = {CoTBox-TTT: Grounding Medical VQA with Visual Chain-of-Thought Boxes During Test-time Training},
author = {Jiahe Qian and Yuhao Shen and Zhangtianyi Chen and Juexiao Zhou and Peisong Wang},
journal= {arXiv preprint arXiv:2511.12446},
year = {2025}
}