重新思考零样本视频分类:面向真实应用的端到端训练
计算机视觉与模式识别
2020-06-23 v4
摘要
在大型数据集上训练,深度学习(DL)可准确将视频分类为数百个不同类别。然而,视频数据标注昂贵。零样本学习(ZSL)针对此问题提出一种解决方案。ZSL训练一次模型,并泛化到训练数据中不存在类别的新任务。我们提出首个用于视频分类中ZSL的端到端算法。我们的训练过程建立在近期视频分类文献的见解之上,并使用可训练的3D CNN学习视觉特征。这与先前视频ZSL方法使用预训练特征提取器形成对比。我们还扩展了当前基准测试范式:先前技术旨在使测试任务在训练时未知,但未达成该目标。我们鼓励训练与测试数据间的域偏移,并禁止针对特定测试数据集定制ZSL模型。我们以大幅优势超越最先进水平。我们的代码、评估过程和模型权重可在github.com/bbrattoli/ZeroShotVideoClassification获取。
引用
@article{arxiv.2003.01455,
title = {Rethinking Zero-shot Video Classification: End-to-end Training for Realistic Applications},
author = {Biagio Brattoli and Joseph Tighe and Fedor Zhdanov and Pietro Perona and Krzysztof Chalupka},
journal= {arXiv preprint arXiv:2003.01455},
year = {2020}
}
备注
Accepted for publication at CVPR 2020