中文

基于注视正则化的视觉语言模型用于第三人称行为理解

计算机视觉与模式识别 2026-03-25 v1

摘要

眼神注视(包括凝视和扫视)为人类意图和未来行动提供关键见解。本研究引入一种注视正则化框架,以增强视觉语言模型(VLM)进行第三人称行为理解。与现有仅依赖视觉数据且忽视注视信息的方法不同,我们的方法在训练过程中直接将注视信息整合到 VLM 架构中。通过生成基于注视的查询,模型能够动态聚焦于注视强调的区域,而注视正则化机制确保模型注意力与人类注意力模式保持一致。为更好地理解如何有效地将注视数据整合到 VLM 中,我们进行了大量实验,探索了多种将注视数据集成到 VLM 的策略。这些创新使模型能够对具有详细行动描述的未来事件进行预测。实验结果表明,与不利用注视数据的基线模型相比,语义得分提升约 13%,凸显了本方法的有效性。这一工作为在 VLM 中利用人类注视提供了基础,显著提升了在需要准确和稳健预测未来事件的应用中的预测能力。

关键词

引用

@article{arxiv.2603.23190,
  title  = {Gaze-Regularized VLMs for Ego-Centric Behavior Understanding},
  author = {Anupam Pani and Yanchao Yang},
  journal= {arXiv preprint arXiv:2603.23190},
  year   = {2026}
}