增强 Transformer 骨干网络用于第一人称视频动作分割
计算机视觉与模式识别
2023-05-25 v2
摘要
视频中的第一人称时序动作分割是计算机视觉中的关键任务,在混合现实、人类行为分析和机器人等领域有诸多应用。尽管近期研究已利用先进的视觉-语言框架,Transformer 仍是动作分割模型的骨干网络。因此,有必要改进 Transformer 以增强动作分割模型的鲁棒性。本工作中,我们提出两种新颖思路来增强用于动作分割的最先进 Transformer。首先,我们引入双重空洞注意力机制,以在局部到全局和全局到局部上下文中自适应捕获层次化表示。其次,我们在编码器与解码器模块间加入交叉连接,以防止解码器丢失局部上下文。我们还利用最先进的视觉-语言表示学习技术为 Transformer 提取更丰富、更紧凑的特征。我们提出的方法在 Georgia Tech Egocentric Activities (GTEA) 和 HOI4D Office Tools 数据集上优于其他最先进方法,并通过消融实验验证了所引入组件的有效性。源代码与补充材料公开于 https://www.sail-nu.com/dxformer。
引用
@article{arxiv.2305.11365,
title = {Enhancing Transformer Backbone for Egocentric Video Action Segmentation},
author = {Sakib Reza and Balaji Sundareshan and Mohsen Moghaddam and Octavia Camps},
journal= {arXiv preprint arXiv:2305.11365},
year = {2023}
}
备注
Joint 3rd Ego4D and 11th EPIC Workshop on Egocentric Vision at CVPR 2023