中文

当时空相遇:动作识别中的时空融合

计算机视觉与模式识别 2024-11-26 v1 机器学习

摘要

视频动作识别取得了显著进展,但仍面临在有效利用空间信息和时间信息方面存在挑战。虽然现有方法常聚焦于空间特征(如物体外观)或时间动态(如运动),但很少综合两者。捕捉视频帧的丰富时序演变,同时保持其空间细节,对提高准确性至关重要。本文引入 Temporal Integration and Motion Enhancement(TIME)层,这是一种新的预处理技术,用于融合时序信息。TIME 层通过重新排列原始序列生成新的视频帧,既保留时序顺序,又将 N2N^2 个时序演化帧嵌入单个 N×NN \times N 的空间网格中。这种转换创建的新帧在空间和时间信息之间取得平衡,使其与现有视频模型兼容。当 N=1N=1 时,层捕获丰富的空间细节,类似于现有方法。随着 NN 增大(N2N\geq2),时序信息变得更为突出,而空间信息减弱,以确保与模型输入的兼容性。我们通过将 TIME 层集成到如 ResNet-50、Vision Transformer 和 Video Masked Autoencoders 等流行的动作识别模型中,对 RGB 和深度视频数据进行实验。我们的实验表明,TIME 层提高了识别准确性,为视频处理任务提供了有价值的见解。

关键词

引用

@article{arxiv.2411.15284,
  title  = {When Spatial meets Temporal in Action Recognition},
  author = {Huilin Chen and Lei Wang and Yifan Chen and Tom Gedeon and Piotr Koniusz},
  journal= {arXiv preprint arXiv:2411.15284},
  year   = {2024}
}

备注

Research report