用于弱监督视频表征学习的双向校准网络
计算机视觉与模式识别
2022-06-22 v1 多媒体
摘要
利用大量网络视频与搜索查询或周边文本(如标题)配对,为有监督视频表征学习提供了一种经济且可扩展的替代方案。然而,由于查询多义性(即一个查询有多种可能含义)和文本同构性(即不同文本具有相同句法结构),对这样的弱视觉-文本关联进行建模并非易事。本文中,我们引入一种查询与文本之间相互校准的新设计,以提升弱监督视频表征学习。具体而言,我们提出双向校准网络 (BCN),其新颖地将两种校准耦合以学习从文本到查询以及反向的修正。技术上,BCN 对由同一查询搜得的全部视频标题进行聚类,并将每个聚类的质心作为文本原型。查询词表直接基于查询词构建。视频到文本/视频到查询在文本原型/查询词表上的投影随后启动文本到查询或查询到文本的校准,以估计对查询或文本的修正。我们还设计了一种选择方案来平衡两种修正。我们新收集了两个大规模网络视频数据集,每个视频均配有查询与标题,用于弱监督视频表征学习,分别命名为 YOVO-3M 和 YOVO-10M。BCN 在 3M 网络视频上习得的视频特征在线性模型协议下的下游任务中取得了优越结果。更显著的是,BCN 在更大的 10M 网络视频集上训练并进一步微调后,在 Kinetics-400 和 Something-Something V2 数据集上相较具有 ImageNet 预训练的当前最优 TDN 和 ACTION-Net 方法,top-1 准确率分别提升 1.6% 和 1.8%。源代码与数据集可在 \url{https://github.com/FuchenUSTC/BCN} 获取。
引用
@article{arxiv.2206.10491,
title = {Bi-Calibration Networks for Weakly-Supervised Video Representation Learning},
author = {Fuchen Long and Ting Yao and Zhaofan Qiu and Xinmei Tian and Jiebo Luo and Tao Mei},
journal= {arXiv preprint arXiv:2206.10491},
year = {2022}
}