用于第一视角视频未来手部分割的生成对抗网络
计算机视觉与模式识别
2022-07-22 v2
摘要
我们提出从第一视角视频中预测未来手部掩膜时间序列这一新问题。一个关键挑战是对未来头部运动的随机性进行建模,而头部运动全局性地影响头戴相机视频分析。为此,我们提出一种新型深度生成模型——EgoGAN,其使用 3D 全卷积网络学习用于像素级视觉预测的时空视频表示,利用生成对抗网络(GAN)生成未来头部运动,并基于视频表示与所生成的未来头部运动预测未来手部掩膜。我们在 EPIC-Kitchens 与 EGTEA Gaze+ 数据集上评估了我们的方法。我们进行了详细的消融实验以验证我们方法的设计选择。此外,我们将我们的方法与先前未来图像分割的最优方法进行比较,表明我们的方法能更准确地预测未来手部掩膜。
引用
@article{arxiv.2203.11305,
title = {Generative Adversarial Network for Future Hand Segmentation from Egocentric Video},
author = {Wenqi Jia and Miao Liu and James M. Rehg},
journal= {arXiv preprint arXiv:2203.11305},
year = {2022}
}