用于视频动作预测的归纳注意力模型
计算机视觉与模式识别
2023-03-21 v2
摘要
基于时空观测预测未来动作在视频理解与预测性计算机视觉中至关重要。此外,具备未来预测能力的模型具有重要应用价值,可使预警系统在事件发生前作出反应。然而,不同于动作识别任务,未来信息在观测时不可获取——模型无法直接映射视频帧至目标动作以解决预测任务。相反,需要时序推理将相关证据与可能的未来动作关联。因此,基于动作识别模型的现有方案仅为次优。近来,研究者提出扩展观测窗口以从过往时刻捕获更长动作前轮廓,并利用注意力检索细微证据以改进预测。然而,现有注意力设计通常以帧输入作为查询,此为次优,因视频帧仅与未来动作弱相关。为此,我们提出一种称为 IAM 的归纳注意力模型,其利用当前预测先验作为查询推断未来动作,并能高效处理长视频内容。此外,我们的方法在注意力设计中通过多对多关联考虑未来的不确定性。结果表明,IAM 在多个大规模第一人称视频数据集上持续优于最先进的预测模型,同时所用模型参数显著更少。
引用
@article{arxiv.2212.08830,
title = {Inductive Attention for Video Action Anticipation},
author = {Tsung-Ming Tai and Giuseppe Fiameni and Cheng-Kuang Lee and Simon See and Oswald Lanz},
journal= {arXiv preprint arXiv:2212.08830},
year = {2023}
}