基于注意力语义单元的视频动作识别
计算机视觉与模式识别
2023-10-11 v2
摘要
视觉-语言模型(VLMs)已显著推进了动作视频识别。在动作标签语义的监督下,近期工作调整 VLM 的视觉分支以学习视频表示。尽管这些工作证明了有效性,我们认为 VLM 的潜力尚未被充分挖掘。有鉴于此,我们挖掘隐藏在动作标签背后的语义单元(SU),并利用其与帧中细粒度条目的相关性以实现更准确的动作识别。SU 是从整个动作集的语言描述中提取的实体,包括身体部位、物体、场景和动作。为了进一步增强视觉内容与 SU 之间的对齐,我们向 VLM 的视觉分支引入了一个多区域模块(MRA)。MRA 允许感知超出原始全局特征的区域感知视觉特征。我们的方法自适应地关注并选择与帧的视觉特征相关的 SU。通过跨模态解码器,所选 SU 用于解码时空视频表示。总之,SU 作为媒介可以提升判别能力与可迁移性。具体而言,在全监督学习中,我们的方法在 Kinetics-400 上取得了 87.8% 的 top-1 准确率。在 K=2 少样本实验中,我们的方法在 HMDB-51 和 UCF-101 上分别超越了先前最优 +7.1% 和 +15.0%。
引用
@article{arxiv.2303.09756,
title = {Video Action Recognition with Attentive Semantic Units},
author = {Yifei Chen and Dapeng Chen and Ruijin Liu and Hao Li and Wei Peng},
journal= {arXiv preprint arXiv:2303.09756},
year = {2023}
}
备注
Accepted at ICCV 2023