基于区域的非局部操作用于视频分类
计算机视觉与模式识别
2021-02-03 v5
摘要
卷积神经网络 (CNNs) 通过深度堆叠小窗口尺寸的卷积操作来建模长程依赖,这使得优化困难。本文提出基于区域的非局部 (RNL) 操作作为一类自注意力机制,其无需使用深度堆叠的局部操作即可直接捕获长程依赖。给定中间特征图,我们的方法通过聚合所有位置的邻域区域信息来重标定某一位置的特征。通过将通道注意力模块与所提出的 RNL 结合,我们设计了一条注意力链,可集成到现成 CNNs 中进行端到端训练。我们在两个视频分类基准上评估了我们的方法。实验结果表明我们的方法优于其他注意力机制,并且在 Something-Something V1 数据集上取得了最先进的性能。
引用
@article{arxiv.2007.09033,
title = {Region-based Non-local Operation for Video Classification},
author = {Guoxi Huang and Adrian G. Bors},
journal= {arXiv preprint arXiv:2007.09033},
year = {2021}
}