面向动作检测的语义与运动感知时空 Transformer 网络
计算机视觉与模式识别
2024-05-15 v1
摘要
本文提出了一种新颖的时空 transformer 网络,引入了多个原创组件用于检测未裁剪视频中的动作。首先,多特征选择性语义注意模型计算空间特征和运动特征之间的相关性,以正确地建模不同动作语义之间的时空相互作用。其次,运动感知网络利用运动感知 2D 位置编码算法对动作语义在视频帧中的位置进行编码。这种运动感知机制记忆了当前方法无法利用的动作帧中动态时空变化。第三,基于序列的时序注意模型捕捉动作帧中的异构时序依赖。与自然语言处理中用于寻找语言词语相似性的标准时序注意力不同,所提出的基于序列的时序注意力旨在确定视频帧之间的差异和相似性,以共同定义动作的含义。所提出的方法在四个时空动作数据集上超过了最先进的解决方案:AVA 2.2、AVA 2.1、UCF101-24 和 EPIC-Kitchens。
引用
@article{arxiv.2405.08204,
title = {A Semantic and Motion-Aware Spatiotemporal Transformer Network for Action Detection},
author = {Matthew Korban and Peter Youngs and Scott T. Acton},
journal= {arXiv preprint arXiv:2405.08204},
year = {2024}
}
备注
IEEE Transactions on Pattern Analysis and Machine Intelligence (2024)