中文

利用多任务学习改进以自我为中心的视频动作识别

计算机视觉与模式识别 2019-09-17 v1 机器学习

摘要

本工作中我们采用多任务学习,利用相关监督任务中存在的结构来训练复杂神经网络。它允许并行地以多个目标训练网络,从而通过利用为容纳比单任务时更多信息而开发的共享表示,来改善其中至少一个任务的性能。我们运用该思想,通过引入额外的监督任务来解决以自我为中心的视频中的动作识别问题。我们考虑学习构成动作标签的动词与名词,并预测捕获手位置与基于注视的视觉显著性的坐标,针对输入视频片段的所有帧。这迫使网络显式关注否则可能错过的来自辅助任务的线索,从而改进推理。我们在EPIC-Kitchens与EGTEA Gaze+上的实验表明,相比单任务基线,多任务训练带来一致提升。此外,在EGTEA Gaze+上我们以3.84%的优势超越动作识别的当前最优(SOTA)。除动作外,我们的方法作为辅助任务生成准确的手与注视估计,且在测试时除RGB视频片段外不需要任何额外输入。

关键词

引用

@article{arxiv.1909.06761,
  title  = {Multitask Learning to Improve Egocentric Action Recognition},
  author = {Georgios Kapidis and Ronald Poppe and Elsbeth van Dam and Lucas Noldus and Remco Veltkamp},
  journal= {arXiv preprint arXiv:1909.06761},
  year   = {2019}
}

备注

10 pages, 3 figures, accepted at the 5th Egocentric Perception, Interaction and Computing (EPIC) workshop at ICCV 2019, code repository: https://github.com/georkap/hand_track_classification