AM Flow:动作识别中的时间处理适配器
计算机视觉与模式识别
2024-11-05 v1
摘要
深度学习模型,特别是图像模型,近年来获得了更强的泛化性和鲁棒性。在本工作中,我们提出利用此类进展于视频分类领域。视频基础模型面临大量预训练和长训练时间的限制。为缓解此类限制,我们提出了"注意力图流"(Attention Map Flow),用于图像模型,以识别每个输入视频帧中与运动相关的像素。在此背景下,我们提出了两种计算AM流的方法,分别对应相机运动的不同情况。AM流允许空间和时间处理的分离,同时相较于视频模型中的联合时空处理提供了更优的结果。适配器作为参数高效迁移学习中的热门技术,有助于将AM流融入预训练图像模型中,避免全量微调。我们通过将时间处理单元融入适配器,将适配器扩展为"时间处理适配器"。我们的工作实现了更快的收敛,从而减少了训练所需的轮数。此外,我们赋予图像模型在热门动作识别数据集上取得最先进结果的能力。这缩短了训练时间并简化了预训练。我们在Kinetics-400、Something-Something v2和Toyota Smarthome数据集上进行了实验,展示了最先进或可比的结果。
引用
@article{arxiv.2411.02065,
title = {AM Flow: Adapters for Temporal Processing in Action Recognition},
author = {Tanay Agrawal and Abid Ali and Antitza Dantcheva and Francois Bremond},
journal= {arXiv preprint arXiv:2411.02065},
year = {2024}
}