AEI:基于自适应注意力的角色-环境交互用于时序动作提议生成
计算机视觉与模式识别
2021-10-26 v2
摘要
人类通常通过对主要角色与周围环境的交互来感知视频中动作的建立。动作仅在视频中主要角色开始与环境交互时才开始,而在其停止交互时结束。尽管时序动作提议生成取得了巨大进展,大多数现有工作忽略了上述事实,将其模型学习为黑盒来提议动作。本文中,我们尝试模拟人类的这种能力,提出角色环境交互(AEI)网络以改善用于时序动作提议生成的视频表示。AEI 包含两个模块,即基于感知的视觉表示(PVR)和边界匹配模块(BMM)。PVR 利用提出的自适应注意力机制,将人与人关系及人与环境关系纳入考虑来表示每个视频片段。随后,视频表示由 BMM 接收以生成动作提议。AEI 在 ActivityNet-1.3 和 THUMOS-14 数据集上,针对时序动作提议与检测任务,使用两种边界匹配架构(即基于 CNN 和基于 GCN)以及两种分类器(即 Unet 和 P-GCN)进行了全面评估。我们的 AEI 鲁棒地优于 SOTA 方法,在时序动作提议生成和时序动作检测上均具有卓越性能和泛化能力。
引用
@article{arxiv.2110.11474,
title = {AEI: Actors-Environment Interaction with Adaptive Attention for Temporal Action Proposals Generation},
author = {Khoa Vo and Hyekang Joo and Kashu Yamazaki and Sang Truong and Kris Kitani and Minh-Triet Tran and Ngan Le},
journal= {arXiv preprint arXiv:2110.11474},
year = {2021}
}
备注
Accepted in BMVC 2021 (Oral Session)