中文

TEACHTEXT:用于文本-视频检索的跨模态广义蒸馏

计算机视觉与模式识别 2021-09-28 v2

摘要

近年来,通过利用视觉和音频数据集上的大规模预训练来构建强大的视频编码器,文本-视频检索任务取得了显著进展。相比之下,尽管存在自然的对称性,设计利用大规模语言预训练的有效算法仍未被充分探索。在这项工作中,我们首次研究此类算法的设计,并提出一种新颖的广义蒸馏方法 TeachText,它利用来自多个文本编码器的互补线索为检索模型提供增强的监督信号。此外,我们将该方法扩展到视频侧模态,并展示我们能在测试时有效减少所用模态数量而不损害性能。我们的方法在多个视频检索基准上大幅推进了当前最优水平(SOTA),且在测试时不增加计算开销。最后但同样重要的是,我们展示了我们方法在消除检索数据集噪声方面的有效应用。代码和数据可在 https://www.robots.ox.ac.uk/~vgg/research/teachtext/ 找到。

关键词

引用

@article{arxiv.2104.08271,
  title  = {TEACHTEXT: CrossModal Generalized Distillation for Text-Video Retrieval},
  author = {Ioana Croitoru and Simion-Vlad Bogolin and Marius Leordeanu and Hailin Jin and Andrew Zisserman and Samuel Albanie and Yang Liu},
  journal= {arXiv preprint arXiv:2104.08271},
  year   = {2021}
}

备注

ICCV 2021