中文

基于感知增强视觉语言模型的目标指代引导扫视路径预测

计算机视觉与模式识别 2026-04-23 v1

摘要

目标指代引导扫视路径预测(ORSP)旨在预测人类在视觉场景中根据描述特定目标对象的语言描述搜索该对象时的注意力扫视路径。多模态信息融合是 ORSP 的一个关键点。因此,我们提出了一种新颖的模型 ScanVLA,首次利用视觉语言模型(VLM)从输入图像和指代表达式中提取并融合内在对齐的视觉和语言特征表示。接下来,为了增强 ScanVLA 对细粒度位置信息的感知,我们不仅提出了一种新颖的历史增强扫视路径解码器(HESD),它直接以历史注视点的位置信息作为输入,以帮助预测当前注视点更合理的位置,而且还采用了一个冻结的分割 LoRA 作为辅助组件,以帮助更精确地定位所指对象,从而在不增加大量额外计算和时间成本的情况下改善扫视路径预测任务。大量实验结果表明,ScanVLA 在目标指引导下能显著优于现有的扫视路径预测方法。

关键词

引用

@article{arxiv.2604.20361,
  title  = {Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models},
  author = {Rong Quan and Yantao Lai and Dong Liang and Jie Qin},
  journal= {arXiv preprint arXiv:2604.20361},
  year   = {2026}
}

备注

ICMR 2026