用于联合估计自我中心凝视与动作的互上下文网络
计算机视觉与模式识别
2023-07-19 v4
摘要
在本文中,我们通过探索自我中心视频中凝视预测与动作识别两项耦合任务的互上下文,来处理它们。我们的假设是:在执行操作任务的过程中,人所进行的动作决定了其注视位置,而注视点揭示了包含关于正在进行动作的重要且互补信息的注视与非注视区域。我们提出了一种新颖的互上下文网络(MCN),以端到端方式联合学习动作依赖的凝视预测与凝视引导的动作识别。在公开自我中心视频数据集上的实验表明,我们的 MCN 在凝视预测与动作识别上均达到了最先进的性能。
引用
@article{arxiv.1901.01874,
title = {Mutual Context Network for Jointly Estimating Egocentric Gaze and Actions},
author = {Yifei Huang and Zhenqiang Li and Minjie Cai and Yoichi Sato},
journal= {arXiv preprint arXiv:1901.01874},
year = {2023}
}