基于视频检索与特征生成的广义少样本视频分类
计算机视觉与模式识别
2021-10-14 v2
摘要
少样本学习旨在从少量样本中识别新类别。尽管在图像领域已取得显著进展,少样本视频分类仍相对较少被探索。我们认为先前的方法低估了视频特征学习的重要性,并提议使用 3D CNN 学习时空特征。我们提出一种两阶段方法,先在基类别上学习视频特征,再在新类别上微调分类器,结果表明这一简单基线方法在现有基准上比先前少样本视频分类方法高出超过 20 个百分点。为规避对标注样本的需求,我们提出两种取得进一步改进的新方法。首先,我们利用标签检索从大型数据集中获取带标签视频,再通过视觉相似性筛选最佳片段。其次,我们学习生成对抗网络(GAN),从其语义嵌入生成新类别的视频特征。此外,我们发现现有基准存在局限,因其每轮测试仅关注 5 个新类别,并引入更现实的基准,涉及更多新类别即少样本学习,以及新类别与基类别混合即广义少样本学习。实验结果表明,我们的检索与特征生成方法在新基准上显著优于基线方法。
引用
@article{arxiv.2007.04755,
title = {Generalized Few-Shot Video Classification with Video Retrieval and Feature Generation},
author = {Yongqin Xian and Bruno Korbar and Matthijs Douze and Lorenzo Torresani and Bernt Schiele and Zeynep Akata},
journal= {arXiv preprint arXiv:2007.04755},
year = {2021}
}
备注
Accepted by TPAMI in October, 2021