MOOSE:通过光流关注视频理解中的时间动态
计算机视觉与模式识别
2025-06-03 v1
摘要
许多以运动为中心的视频分析任务,如原子动作、检测自闭症个体的非典型运动行为,或分析人类语音实时 MRI 中的发音运动,都需要高效且可解释的时间建模。捕捉时间动态是视频分析的核心挑战,通常需要大量的计算资源和不易获取的细粒度标注。本文提出了 MOOSE (Motion Flow Over Spatial Space),一种受人类运动感知启发、显式地将光流与空间嵌入相结合以高效建模时间信息的新型以时间为中心的视频编码器。与以往模型不同,MOOSE 利用丰富且广泛可用的预训练视觉和光流编码器,而不是从头训练视频模型。这显著降低了计算复杂度,同时增强了时间可解释性。我们的主要贡献包括:(1) 提出一种计算高效的以时间为中心的视频理解架构;(2) 展示了在建模时间动态方面增强的可解释性;(3) 在包括临床、医学和标准动作识别数据集在内的多种基准上取得了 SOTA 性能,证实了我们方法的广泛适用性和有效性。
引用
@article{arxiv.2506.01119,
title = {MOOSE: Pay Attention to Temporal Dynamics for Video Understanding via Optical Flows},
author = {Hong Nguyen and Dung Tran and Hieu Hoang and Phong Nguyen and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2506.01119},
year = {2025}
}