中文

凝视思考:顺序眼动追踪作为医学视觉语言模型的视觉推理监督

计算机视觉与模式识别 2026-03-10 v1 人工智能

摘要

视觉-语言模型(VLM)将图像处理为视觉标记,但其中间推理通常在文本中完成,这对于基于视觉的放射科学任务可能并不理想。放射科学家通常通过顺序视觉搜索来进行诊断,眼动追踪捕捉了这一过程作为时间有序的凝视轨迹,揭示了证据如何随时间获取。我们利用眼动作为监督信号引导 VLM 推理,通过引入一小组专用凝视标记来实现。这些标记被训练预测按时间顺序选择的图像块索引,鼓励模型遵循人类式的证据获取和集成。在 MIMIC-EYE 和多个外部零样本基准上的实验表明,与基线相比性能持续提升,实现了领域内最先进的性能并提高了跨域鲁棒性。这些结果表明,时间有序的凝视信号是学习在视觉上依托医学推理的有效监督信号。

关键词

引用

@article{arxiv.2603.06697,
  title  = {Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs},
  author = {Yiwei Li and Zihao Wu and Yanjun Lv and Hanqi Jiang and Weihang You and Zhengliang Liu and Dajiang Zhu and Xiang Li and Quanzheng Li and Tianming Liu and Lin Zhao},
  journal= {arXiv preprint arXiv:2603.06697},
  year   = {2026}
}