基于非对齐文本的顺序视频弱监督视频表示学习
计算机视觉与模式识别
2023-03-29 v2
摘要
顺序视频理解作为一种新兴的视频理解任务,因其目标导向的特性引起了众多研究者的关注。本文研究弱监督顺序视频理解,其中不提供精确的时间戳级文本-视频对齐。我们通过借鉴 CLIP 的思想来解决该任务。具体而言,我们使用 transformer 聚合帧级特征以得到视频表示,并分别使用预训练文本编码器编码对应于每个动作及整个视频的文本。为建模文本与视频间的对应关系,我们提出一种多粒度损失,其中视频-段落对比损失强制整个视频与完整脚本匹配,细粒度帧-句子对比损失强制每个动作与其描述匹配。由于帧-句子对应关系不可用,我们提出利用视频动作在时间域中顺序发生的事实来生成伪帧-句子对应关系,并用伪标签监督网络训练。在视频序列验证与文本到视频匹配上的大量实验表明,我们的方法大幅优于基线,验证了所提方法的有效性。代码发布于 https://github.com/svip-lab/WeakSVR。
引用
@article{arxiv.2303.12370,
title = {Weakly Supervised Video Representation Learning with Unaligned Text for Sequential Videos},
author = {Sixun Dong and Huazhang Hu and Dongze Lian and Weixin Luo and Yicheng Qian and Shenghua Gao},
journal= {arXiv preprint arXiv:2303.12370},
year = {2023}
}
备注
CVPR 2023. Code: https://github.com/svip-lab/WeakSVR