细察少样本视频分类:一种新基线与基准
计算机视觉与模式识别
2021-10-26 v1
摘要
现有少样本视频分类方法常采用元学习范式,通过设计定制的时序对齐模块进行相似度计算。尽管已取得显著进展,这些方法未能聚焦于学习有效表示,且严重依赖 ImageNet 预训练,由于语义重叠,这对少样本识别设定可能并不合理。本文旨在通过三项贡献对少样本视频分类进行深入研究。首先,我们对现有基于度量的方法开展一致性比较研究,以查明其在表示学习上的局限。相应地,我们提出一种无任何时序对齐的简洁基于分类器的基线,其惊人地优于最先进的基于元学习的方法。其次,我们发现新动作类别与 ImageNet 物体类别间存在高相关性,这在少样本识别设定中是有问题的。我们的结果显示从头训练的性能显著下降,意味着现有基准无法提供足够基类数据。最后,我们提出一个具有更多基类数据的新基准,以助力未来无预训练的少样本视频分类。代码将发布于 https://github.com/MCG-NJU/FSL-Video。
引用
@article{arxiv.2110.12358,
title = {A Closer Look at Few-Shot Video Classification: A New Baseline and Benchmark},
author = {Zhenxi Zhu and Limin Wang and Sheng Guo and Gangshan Wu},
journal= {arXiv preprint arXiv:2110.12358},
year = {2021}
}
备注
BMVC2021 camera-ready version