面向少数的邻域扩展与注意力聚合用于视频长尾识别
计算机视觉与模式识别
2022-11-28 v1
摘要
现实世界视频量的急剧增长及其类别的极度多样与不断涌现,自然形成了视频类别的长尾分布,这凸显了视频长尾识别(VLTR)的需求。本文中,我们总结了 VLTR 中的挑战并探索如何克服它们。这些挑战是:(1)为获取高质量特征而重新训练整个模型是不切实际的;(2)获取帧级标签需要巨大成本;(3)长尾数据引发有偏训练。然而,现有大多数 VLTR 工作不可避免地使用从预训练模型提取的与任务无关的图像级特征,并以视频级标签进行学习。因此,为应对此类(1)任务无关特征与(2)视频级标签,我们引入两个互补的可学习特征聚合器。每个聚合器中的可学习层用于产生任务相关表示,且每个聚合器用于将片段级知识组装为视频表征。接着,我们提出面向少数的邻域扩展(MOVE),显式利用类别频率来近似邻域分布,以缓解(3)有偏训练。结合这些方案,我们的方法在大规模 VideoLT 与合成诱导的 Imbalanced-MiniKinetics200 上取得了最先进结果。使用来自 ResNet-50 的 VideoLT 特征,相较于先前最先进方法,其在头部与尾部类上分别获得了 18% 与 58% 的相对提升。
引用
@article{arxiv.2211.13471,
title = {Minority-Oriented Vicinity Expansion with Attentive Aggregation for Video Long-Tailed Recognition},
author = {WonJun Moon and Hyun Seok Seong and Jae-Pil Heo},
journal= {arXiv preprint arXiv:2211.13471},
year = {2022}
}
备注
Accepted to AAAI 2023. Code is available at https://github.com/wjun0830/MOVE