从识别到预测:利用序列推理进行动作预期
计算机视觉与模式识别
2024-08-07 v1
摘要
动作预期任务指根据观察到的视频预测将发生的动作,这需要模型具备强大的总结当下并推理未来的能力。经验和常识表明,不同动作之间存在显著的相关性,这为动作预期任务提供了宝贵的先验知识。然而,先前的方法并未有效地建模这一底层统计关系。为此,我们提出一种新型端到端视频建模架构,利用注意力机制,称为Anticipation via Recognition and Reasoning(ARR)。ARR将动作预期任务分解为动作识别和序列推理任务,通过下一动作预测(NAP)有效学习动作之间的统计关系。在与现有时间聚合策略相比,ARR能够从可观测视频中提取更有效的特征,以作出更合理的预测。此外,为了解决需要大量训练数据的关系建模挑战,我们提出了一种创新的解码器无监督预训练方法,利用视频内在的时间动态增强网络的推理能力。在Epic-kitchen-100、EGTEA Gaze+和50salads数据集上进行大量实验,证明了所提方法的有效性。代码已公开于https://github.com/linuxsino/ARR。
引用
@article{arxiv.2408.02769,
title = {From Recognition to Prediction: Leveraging Sequence Reasoning for Action Anticipation},
author = {Xin Liu and Chao Hao and Zitong Yu and Huanjing Yue and Jingyu Yang},
journal= {arXiv preprint arXiv:2408.02769},
year = {2024}
}
备注
Accepted by ACM TOMM