当时空相遇:动作识别中的时空融合
计算机视觉与模式识别
2024-11-26 v1 机器学习
摘要
视频动作识别取得了显著进展,但仍面临在有效利用空间信息和时间信息方面存在挑战。虽然现有方法常聚焦于空间特征(如物体外观)或时间动态(如运动),但很少综合两者。捕捉视频帧的丰富时序演变,同时保持其空间细节,对提高准确性至关重要。本文引入 Temporal Integration and Motion Enhancement(TIME)层,这是一种新的预处理技术,用于融合时序信息。TIME 层通过重新排列原始序列生成新的视频帧,既保留时序顺序,又将 个时序演化帧嵌入单个 的空间网格中。这种转换创建的新帧在空间和时间信息之间取得平衡,使其与现有视频模型兼容。当 时,层捕获丰富的空间细节,类似于现有方法。随着 增大(),时序信息变得更为突出,而空间信息减弱,以确保与模型输入的兼容性。我们通过将 TIME 层集成到如 ResNet-50、Vision Transformer 和 Video Masked Autoencoders 等流行的动作识别模型中,对 RGB 和深度视频数据进行实验。我们的实验表明,TIME 层提高了识别准确性,为视频处理任务提供了有价值的见解。
引用
@article{arxiv.2411.15284,
title = {When Spatial meets Temporal in Action Recognition},
author = {Huilin Chen and Lei Wang and Yifan Chen and Tom Gedeon and Piotr Koniusz},
journal= {arXiv preprint arXiv:2411.15284},
year = {2024}
}
备注
Research report