所见即所见:面向第一人称与第三人称视频协同分析的联合注意力学习
计算机视觉与模式识别
2019-04-17 v1
摘要
近年来,越来越多的视频由可穿戴相机以第一人称视角拍摄。此类第一人称视频除传统第三人称视频外提供了额外信息,因而具有广泛应用。然而,分析第一人称视频的技术可能与第三人称视频有本质不同,且探索两种视角下的共享信息更为困难。本文提出一种用于第一人称与第三人称视频协同分析的新方法。我们方法的核心为“联合注意力”概念,即对应于不同视角中共享注意力区域并可由此联系两种视角的可学习表示。为此,我们开发了一个具有三元组损失的多分支深度网络,通过自监督学习从第一人称与第三人称视频中提取联合注意力。我们在带有跨视角视频匹配任务的公开数据集上评估了我们的方法。我们的方法在定性与定量上均优于当前最优(state-of-the-art)。我们还通过一组额外实验展示了所学联合注意力如何惠及多种应用。
引用
@article{arxiv.1904.07424,
title = {What I See Is What You See: Joint Attention Learning for First and Third Person Video Co-analysis},
author = {Huangyue Yu and Minjie Cai and Yunfei Liu and Feng Lu},
journal= {arXiv preprint arXiv:1904.07424},
year = {2019}
}