基于支持集的交叉监督用于视频定位
计算机视觉与模式识别
2021-08-25 v1
摘要
当前的视频定位方法提出了各种复杂的架构来捕获视频-文本关系,并取得了令人瞩目的改进。然而,事实上,仅通过架构设计很难学习复杂的多模态关系。在本文中,我们引入了一个新颖的基于支持集的交叉监督(Sscs)模块,该模块可以在训练阶段改进现有方法,而无需额外的推理成本。所提出的Sscs模块包含两个主要组件,即判别性对比目标和生成性字幕目标。对比目标旨在通过对比学习来学习有效的表示,而字幕目标则可以训练一个由文本监督的强大视频编码器。由于在真值和背景区间中都存在某些视觉实体,即互斥性,朴素的对比学习不适用于视频定位。我们通过利用支持集概念来增强交叉监督,从而解决了这个问题,该概念从整个视频中收集视觉信息并消除了实体的互斥性。结合原始目标,Sscs可以增强现有方法的多模态关系建模能力。我们在三个具有挑战性的数据集上广泛评估了Sscs,并表明我们的方法可以大幅提升当前最先进方法的性能,特别是在Charades-STA数据集上,[email protected]指标提升了6.35%。
引用
@article{arxiv.2108.10576,
title = {Support-Set Based Cross-Supervision for Video Grounding},
author = {Xinpeng Ding and Nannan Wang and Shiwei Zhang and De Cheng and Xiaomeng Li and Ziyuan Huang and Mingqian Tang and Xinbo Gao},
journal= {arXiv preprint arXiv:2108.10576},
year = {2021}
}
备注
Accepted by ICCV 2021