面向视频动作预期的统一递归建模
计算机视觉与模式识别
2022-06-03 v1
摘要
基于当前条件的证据预测未来事件是人类的固有技能,也是预测任何决策结果的关键。例如在人工视觉中,我们希望在目标动作发生前预测其下一步人类动作,而无需观测与之相关的未来视频帧。用于动作预期的计算机视觉模型需收集目标动作前奏中的细微证据。在先前研究中,递归建模常带来更好性能,强时间推断被认为是合理预测的关键要素。为此,我们通过消息传递框架提出一种面向视频动作预期的统一递归建模。时空中的信息流可由顶点与边之间的交互描述,且各传入帧引起的顶点变化反映了底层动态。我们的模型利用自注意力作为各消息传递函数的构建模块。此外,我们引入不同的边学习策略,可端到端优化以获得顶点间连接的更好灵活性。实验结果表明,我们所提方法在大规模 EPIC-Kitchen 数据集上优于以往工作。
引用
@article{arxiv.2206.01009,
title = {Unified Recurrence Modeling for Video Action Anticipation},
author = {Tsung-Ming Tai and Giuseppe Fiameni and Cheng-Kuang Lee and Simon See and Oswald Lanz},
journal= {arXiv preprint arXiv:2206.01009},
year = {2022}
}