中文

通过自适应边界提升视频检索

计算机视觉与模式识别 2023-03-10 v1 计算与语言

摘要

由于互联网上视频的迅速涌现,视频检索正变得愈发重要。视频检索的主流范式通过学习视频-文本表示,将正样本对相似度与负样本对相似度之间的距离推离一个固定边界。然而,用于训练的负样本对是随机采样的,这意味着负样本对之间的语义可能相关甚至等价,而大多数方法仍强制不相似的表示以降低其相似度。这一现象导致监督不准确以及视频-文本表示学习的性能不佳。尽管大多数视频检索方法忽视了该现象,我们提出了一种随正负样本对距离变化的自适应边界来解决上述问题。首先,我们设计了自适应边界的计算框架,包括距离度量方法以及距离与边界之间的函数。然后,我们探索了一种称为“跨模态广义自蒸馏”(Cross-Modal Generalized Self-Distillation, CMGSD)的新实现,它可构建在大多数视频检索模型之上且只需少量修改。值得注意的是,CMGSD 在训练时增加极少计算开销,在测试时不增加计算开销。在三个广泛使用的数据集上的实验结果表明,所提方法能比相应的骨干模型取得显著更好的性能,并以较大优势优于最先进的方法。

关键词

引用

@article{arxiv.2303.05093,
  title  = {Improving Video Retrieval by Adaptive Margin},
  author = {Feng He and Qi Wang and Zhifan Feng and Wenbin Jiang and Yajuan Lv and Yong zhu and Xiao Tan},
  journal= {arXiv preprint arXiv:2303.05093},
  year   = {2023}
}

备注

Accepted by SIGIR 2021