面向零样本视频分类的对齐-均匀性感知表征学习
计算机视觉与模式识别
2022-03-30 v1
摘要
多数方法通过对齐已见类内的视觉-语义表征来解决零样本视频分类,这限制了对未见类的泛化。为增强模型泛化性,本文提出一个端到端框架,在已见与未见类上均保持表征的对齐性与均匀性。具体而言,我们构造一个监督对比损失,以同时对齐视觉-语义特征(即对齐)并促使所学特征均匀分布(即均匀性)。与仅考虑对齐的现有方法不同,我们提出均匀性以保留已有特征的最大信息,从而提高未观测特征落于观测数据附近的概率。此外,我们通过提出一个在已见类特征上插值与外推的类生成器来合成未见类特征。另外,我们引入两个度量指标——紧致度与离散度,以量化这两种性质并作为模型泛化性的新测度。实验表明,我们的方法在 UCF101 与 HMDB51 上分别以 28.1% 与 27.0% 的相对提升显著优于 SOTA。代码已公开。
引用
@article{arxiv.2203.15381,
title = {Alignment-Uniformity aware Representation Learning for Zero-shot Video Classification},
author = {Shi Pu and Kaili Zhao and Mao Zheng},
journal= {arXiv preprint arXiv:2203.15381},
year = {2022}
}
备注
CVPR 2022