运动遇注意力:视频运动提示
计算机视觉与模式识别
2024-10-03 v2 人工智能
机器学习
摘要
视频包含丰富的时空信息。传统方法用于提取运动,用于诸如动作识别等任务,往往依赖于视觉内容而非精确的运动特征。这种现象被称为“盲动提取”行为,由于缺乏运动引导的线索,捕获感兴趣运动方面效率不高。最近,注意力机制已显著增强许多计算机视觉任务,通过有效突出显示关键视觉区域。以此为灵感,我们提出一种带可学习斜率和平移参数的修改 Sigmoid 函数作为注意力机制,用于调制来自帧差图的运动信号。该方法生成一系列注意力图,以增强处理与运动相关的视频内容。为确保注意力图的时序连续性和平滑性,我们应用成对的时序注意力变化正则化,以去除不必要的运动(如噪声)同时保留重要运动。随后,我们对每对注意力图和原始视频帧执行哈德玛积,以突出显示随时间演化的感兴趣运动。这些被突出显示的运动被称为视频运动提示,随后用作模型输入代替原始视频帧。我们将此过程正式化为运动提示层,并将正则化项纳入损失函数以学习更好的运动提示。该层作为模型与视频数据之间的适配器,弥合了传统“盲动提取”与提取感兴趜求运动之间的差距。我们展示了该轻量级、即插即用的运动提示层无缝集成到像 SlowFast、X3D 和 TimeSformer 等模型中,在诸如 FineGym 和 MPII Cooking 2 等基准上实现性能提升。
引用
@article{arxiv.2407.03179,
title = {Motion meets Attention: Video Motion Prompts},
author = {Qixiang Chen and Lei Wang and Piotr Koniusz and Tom Gedeon},
journal= {arXiv preprint arXiv:2407.03179},
year = {2024}
}
备注
Accepted at the 16th Asian Conference on Machine Learning (ACML 2024)