用于第一人称动作识别的运动与外观自监督联合编码
计算机视觉与模式识别
2020-12-08 v2
摘要
可穿戴相机在若干应用中的普及度日益提升,增加了研究界开发从第一人称视角识别动作方法的兴趣。以自我为中心的动作识别中的一个开放挑战是,视频缺乏关于主要参与者姿态的详细信息,从而在聚焦于操作任务时往往仅记录下部分运动。因此,关于动作本身的信息量有限,使得对被操纵物体及其上下文的理解变得至关重要。许多先前工作以双流架构解决此问题,其中一流专用于建模动作中所涉物体的外观,另一流从光流中提取运动特征。本文中,我们认为从这两个信息通道联合学习特征有益于更好地捕捉二者间的时空相关性。为此,我们提出了一种能够做到这一点的单流架构,这得益于增加了一个自监督模块,其利用一个 pretext 运动预测任务将运动与外观知识交织在一起。在多个公开可用数据库上的实验展示了我们方法的威力。
引用
@article{arxiv.2002.03982,
title = {Self-Supervised Joint Encoding of Motion and Appearance for First Person Action Recognition},
author = {Mirco Planamente and Andrea Bottino and Barbara Caputo},
journal= {arXiv preprint arXiv:2002.03982},
year = {2020}
}
备注
Accepted to ICPR 2020