中文

用于零样本视频识别的正交时间插值

计算机视觉与模式识别 2023-08-15 v1 多媒体

摘要

零样本视频识别(ZSVR)旨在识别模型训练过程中未见过的视频类别。近来,在大规模图文对上预训练的视觉-语言模型(VLMs)已展现出对ZSVR的令人印象深刻的迁移能力。为使VLMs适用于视频领域,现有方法常在图像级编码器后使用额外的时间学习模块来学习视频帧间的时间关系。遗憾的是,对于未见类别的视频,我们观察到一种异常现象:使用时空特征的模型表现远差于移除时间学习模块而仅使用空间特征的模型。我们推测,对视频的不当时间建模破坏了视频的空间特征。为验证假设,我们提出特征分解以保留视频的正交时间特征,并利用插值构建精炼的时空特征。使用适当精炼时空特征的模型表现优于仅使用空间特征的模型,验证了正交时间特征对ZSVR任务的有效性。因此,设计了一个正交时间插值模块,以在训练期间学习更好的精炼时空视频特征。此外,引入了一种匹配损失以提高正交时间特征的质量。我们基于VLMs采用正交时间插值与匹配损失提出了一种称为OTI的ZSVR模型。在流行视频数据集(即Kinetics-600、UCF101与HMDB51)上的ZSVR准确率表明,OTI以明显优势优于先前的最先进方法。

关键词

引用

@article{arxiv.2308.06897,
  title  = {Orthogonal Temporal Interpolation for Zero-Shot Video Recognition},
  author = {Yan Zhu and Junbao Zhuo and Bin Ma and Jiajia Geng and Xiaoming Wei and Xiaolin Wei and Shuhui Wang},
  journal= {arXiv preprint arXiv:2308.06897},
  year   = {2023}
}