从视觉认知获取启发:理解人类动作动态的整体视线与精细注视 Transformer
计算机视觉与模式识别
2026-04-09 v1
摘要
最近,Transformer 在各种视觉任务中取得了显著的进展。为在视频任务中平衡计算和效率,最近的工作大量依赖于因子化或基于窗口的自注意力。然而,这些方法在视频中将时空相关性分割到感兴趣的区域,从而限制了模型捕获运动和长程依赖的能力。在本文中,我们认为,类似于人类视觉系统,时空信息的重要性在不同的时间尺度上有所不同,注意力通过视线和凝视行为在时间上稀疏地分配。在视频任务中,是否需要对时间和空间进行平等的考虑才能取得成功?为了验证这一理解,我们提出了一个名为 Overall Glance and Refined Gaze(OG-ReG)Transformer 的双路径网络。Glance 路径提取粗粒度的整体时空信息,而 Gaze 路径通过提供局部细节来补充 Glance 路径。我们的模型在 Kinetics-400、Something-Something v2 和 Diving-48 上实现了最先进的结果,显示出竞争性的性能。代码将在 https://github.com/linuxsino/OG-ReG 可用。
引用
@article{arxiv.2604.06783,
title = {Insights from Visual Cognition: Understanding Human Action Dynamics with Overall Glance and Refined Gaze Transformer},
author = {Bohao Xing and Deng Li and Rong Gao and Xin Liu and Heikki Kälviäinen},
journal= {arXiv preprint arXiv:2604.06783},
year = {2026}
}