中文

基于表观与时间对齐的归纳与转导少样本视频分类

计算机视觉与模式识别 2022-07-25 v1

摘要

我们提出一种新颖的少样本视频分类方法,该方法执行表观与时间对齐。具体而言,给定一对查询与支持视频,我们通过帧级特征匹配进行表观对齐以获得视频间的表观相似度分数,同时利用时间顺序保持先验来获得视频间的时间相似度分数。此外,我们引入一个少样本视频分类框架,在多个步骤中利用上述表观与时间相似度分数,即基于原型的训练与测试,以及归纳与转导原型精炼。据我们所知,我们的工作是首个探索转导少样本视频分类的。在Kinetics与Something-Something V2数据集上的大量实验表明,对于具有时间顺序敏感性的数据集(如Something-Something V2),表观与时间对齐均至关重要。我们的方法在两个数据集上取得了与先前方法相当或更好的结果。我们的代码可在 https://github.com/VinAIResearch/fsvc-ata 获取。

关键词

引用

@article{arxiv.2207.10785,
  title  = {Inductive and Transductive Few-Shot Video Classification via Appearance and Temporal Alignments},
  author = {Khoi D. Nguyen and Quoc-Huy Tran and Khoi Nguyen and Binh-Son Hua and Rang Nguyen},
  journal= {arXiv preprint arXiv:2207.10785},
  year   = {2022}
}

备注

Accepted to ECCV 2022