用于动作分割的分层注意力网络
计算机视觉与模式识别
2020-05-08 v1
摘要
事件的时间分割是一项基本任务,也是视频中人体动作自动识别的前置步骤。已有若干尝试通过注意力机制捕获帧级显著特征,但由于仅捕获有限时间跨度的依赖关系,它们缺乏有效映射帧间时间关系的能力。为此,我们提出一种完整的端到端监督学习方法,能够更好地学习时间上动作之间的关系,从而提升整体分割性能。所提出的分层循环注意力框架在多个时间尺度上分析输入视频,以形成帧级和段级的嵌入,并执行细粒度动作分割。这生成了一个简单、轻量却极为有效的架构,用于分割连续视频流,并具有多种应用领域。我们在多个具有挑战性的公开基准数据集上评估我们的系统,包括 MERL Shopping、50 salads 和 Georgia Tech Egocentric 数据集,并取得了 state-of-the-art 性能。所评估的数据集涵盖众多视频采集设置,包括静态俯视相机视角和动态的、自我中心的头戴式相机视角,证明了所提出框架在各种设置下的直接适用性。
引用
@article{arxiv.2005.03209,
title = {Hierarchical Attention Network for Action Segmentation},
author = {Harshala Gammulle and Simon Denman and Sridha Sridharan and Clinton Fookes},
journal= {arXiv preprint arXiv:2005.03209},
year = {2020}
}
备注
Published in Pattern Recognition Letters