用于动作预测的对抗记忆网络
计算机视觉与模式识别
2021-12-21 v1
摘要
动作预测旨在利用部分观测的视频推断即将发生的人类动作,由于早期观测所蕴含的信息有限,这是一项具有挑战性的任务。现有方法主要采用重构策略来处理该任务,期望学习一个从部分观测到完整视频的单一映射函数以促进预测过程。在本研究中,我们提出对抗记忆网络(AMemNet),从两个新角度基于部分视频查询生成“完整视频”特征。首先,设计了一个键值结构记忆生成器,将不同的部分视频记忆为键记忆,并通过门控机制与查询注意力动态地将完整视频写入值记忆。其次,我们开发了一个类别感知判别器,在对抗训练下引导记忆生成器生成不仅真实而且具有判别力的完整视频特征。AMemNet 的最终预测结果通过对 RGB 与光流流进行后期融合给出。在两个基准视频数据集 UCF-101 和 HMDB51 上的大量实验结果证明了所提出的 AMemNet 模型相对于最先进方法的有效性。
引用
@article{arxiv.2112.09875,
title = {Adversarial Memory Networks for Action Prediction},
author = {Zhiqiang Tao and Yue Bai and Handong Zhao and Sheng Li and Yu Kong and Yun Fu},
journal= {arXiv preprint arXiv:2112.09875},
year = {2021}
}