中文

TransVCL:具有灵活监督的注意力增强视频拷贝定位网络

计算机视觉与模式识别 2022-11-28 v2

摘要

视频拷贝定位旨在视频检索应用中精确地在成对未裁剪视频内定位所有被拷贝的片段。先前方法通常从由输入视频对帧级特征的余弦相似度生成的帧间相似度矩阵出发,然后在时间约束下于相似度矩阵上检测并精修拷贝片段边界。本文中,我们提出 TransVCL:一种注意力增强的视频拷贝定位网络,它直接从初始帧级特征优化并端到端训练,包含三个主要组件:用于特征增强的定制 Transformer、用于相似度矩阵生成的关联与 softmax 层,以及用于拷贝片段定位的时间对齐模块。与先前需要手工相似度矩阵的方法不同,TransVCL 利用自注意力与交叉注意力层融合了特征序列对间的长程时间信息。借助三组件的联合设计与优化,相似度矩阵可被学习以呈现更具判别性的拷贝模式,从而在段级标注数据集(VCSL 与 VCDB)上相较先前方法取得显著提升。除在全监督设定下的 SOTA 性能外,该注意力架构便于 TransVCL 进一步利用未标注或仅视频级标注的数据。补充视频级标注数据集(包括 SVD 与 FIVR)的额外实验揭示了 TransVCL 从全监督到半监督(含或不含视频级标注)的高灵活性。代码公开于 https://github.com/transvcl/TransVCL。

关键词

引用

@article{arxiv.2211.13090,
  title  = {TransVCL: Attention-enhanced Video Copy Localization Network with Flexible Supervision},
  author = {Sifeng He and Yue He and Minlong Lu and Chen Jiang and Xudong Yang and Feng Qian and Xiaobo Zhang and Lei Yang and Jiandong Zhang},
  journal= {arXiv preprint arXiv:2211.13090},
  year   = {2022}
}

备注

Accepted by the Thirty-Seventh AAAI Conference on Artificial Intelligence(AAAI2023)