预测未来:一种联合学习的动作预期模型
计算机视觉与模式识别
2019-12-17 v1
摘要
受人类用于动作预期的神经营结构启发,我们提出一种动作预期模型,该模型通过预测视觉未来和时间未来来实现对合理未来动作的预测。与当前先学习模型预测未来视频特征、再利用这些特征进行动作预期的最优方法不同,所提框架联合学习执行两项任务:未来视觉与时间表征合成,以及早期动作预期。该联合学习框架确保所预测的未来嵌入对动作预期任务具有信息性。此外,通过大量实验评估,我们展示了同时使用场景的视觉与时间语义的效用,并说明了如何通过循环生成对抗网络(GAN)框架实现这种表征合成。我们的模型在多个数据集上优于当前最优方法:UCF101、UCF101-24、UT-Interaction和TV Human Interaction。
引用
@article{arxiv.1912.07148,
title = {Predicting the Future: A Jointly Learnt Model for Action Anticipation},
author = {Harshala Gammulle and Simon Denman and Sridha Sridharan and Clinton Fookes},
journal= {arXiv preprint arXiv:1912.07148},
year = {2019}
}
备注
ICCV 2019