具有引导-反馈循环机制的意图动作预测模型
计算机视觉与模式识别
2024-03-20 v1
摘要
从视频中预测人类意图具有广泛的应用,如自动驾驶、机器人辅助技术和虚拟现实。本研究利用第一人称视频序列来解决意图动作预测问题,以估计指示人类意图的动作。我们提出了一种分层完整-近期(Hierarchical Complete-Recent, HCR)信息融合模型,该模型充分利用了整个视频序列的特征(即完整特征)和视频尾部序列的特征(即近期特征)。HCR 模型有两个主要机制。引导-反馈循环(Guide-Feedback Loop, GFL)机制被提出用于建模一个近期特征与一个完整特征之间的关系。基于 GFL,提出了多完整-近期特征聚合(MultiComplete-Recent Feature Aggregation, MCRFA)模块,用于建模一个近期特征与多尺度完整特征之间的关系。基于 GFL 和 MCRFA,HCR 模型可以分层地探索多尺度完整特征与多尺度近期特征之间丰富的相互关系。通过对比和消融实验,我们在两个著名的公开数据集 EPIC-Kitchens 和 EGTEA Gaze+ 上验证了模型的有效性。
引用
@article{arxiv.2403.12450,
title = {Intention Action Anticipation Model with Guide-Feedback Loop Mechanism},
author = {Zongnan Ma and Fuchun Zhang and Zhixiong Nan and Yao Ge},
journal= {arXiv preprint arXiv:2403.12450},
year = {2024}
}