基于动作原型的早期动作识别
计算机视觉与模式识别
2023-12-12 v1
摘要
早期动作识别是一个重要且具挑战性的问题,它能够在活动可能未完成甚至未开始的情况下,从部分观测的视频流中识别动作。在这项工作中,我们提出了一种新颖的模型,该模型为每个类别学习完整动作的原型表示,并利用它来正则化架构以及部分观测的视觉表示。我们的模型设计非常简单且高效。我们将视频分解为短片段,视觉编码器从每个片段中独立提取特征。随后,解码器以在线方式聚合所有片段的特征,用于最终的类别预测。在训练期间,对于每次部分观测,模型被联合训练以预测标签以及作为正则化器的动作原型表示。我们在多个具有挑战性的真实世界数据集上评估了我们的方法,并以显著优势超越了当前的最先进水平。例如,在仅观测每个视频前 10% 的早期识别中,我们的方法在 Something-Something-v2 上的 Top-1 准确率比 SOTA 提高了 +2.23,在 UCF-101 上提高了 +3.55,在 SSsub21 上提高了 +3.68,在 EPIC-Kitchens-55 上提高了 +5.03,而先前的工作使用了多模态输入(例如光流)或批量推理。最后,我们还进行了详尽的消融研究,以说明我们做出的设计选择,并收集关于我们的模型在语义上学习到了什么的见解。
引用
@article{arxiv.2312.06598,
title = {Early Action Recognition with Action Prototypes},
author = {Guglielmo Camporese and Alessandro Bergamo and Xunyu Lin and Joseph Tighe and Davide Modolo},
journal= {arXiv preprint arXiv:2312.06598},
year = {2023}
}