物体如何助力动作识别?
计算机视觉与模式识别
2023-06-21 v1
摘要
当前最先进的视频模型将视频片段视为长序列的时空 token 进行处理。然而,它们并未显式建模物体及其在视频中的交互,而是处理视频中的所有 token。本文研究如何利用物体知识设计更优的视频模型,即处理更少的 token 并提升识别准确率。这与先前或以准确率为代价丢弃 token、或提升准确率同时增加计算量的工作形成对比。首先,我们提出一种物体引导的 token 采样策略,能够以最小准确率影响保留一小部分输入 token。其次,我们提出一种物体感知注意力模块,用物体信息丰富特征表示并提升整体准确率。我们的框架在使用比强基线更少 token 时取得更优性能。具体而言,在 SomethingElse、Something-something v2 和 Epic-Kitchens 上,我们分别以 30%、40% 和 60% 的输入 token 匹配基线。当我们以与基线相同数量的 token 运行模型时,在这些数据集上提升了 0.6 至 4.2 个点。
引用
@article{arxiv.2306.11726,
title = {How can objects help action recognition?},
author = {Xingyi Zhou and Anurag Arnab and Chen Sun and Cordelia Schmid},
journal= {arXiv preprint arXiv:2306.11726},
year = {2023}
}
备注
CVPR 2023