中文

MDMMT:用于视频检索的多域多模态 Transformer

计算机视觉与模式识别 2021-11-09 v1

摘要

我们在 MSRVTT 与 LSMDC 基准上的文本到视频检索任务上提出了新的最优结果,我们的模型以大幅优势超越所有先前方案。此外,在无需微调的情况下,单一模型在两个数据集上均达到最优结果。这种多域泛化通过不同视频字幕数据集的恰当组合实现。我们展示在不同数据集上训练可改善彼此的测试结果。另外我们检查了许多流行数据集的交集,发现 MSRVTT 的测试部分与训练部分存在显著重叠,ActivityNet 中也观察到相同情况。

关键词

引用

@article{arxiv.2103.10699,
  title  = {MDMMT: Multidomain Multimodal Transformer for Video Retrieval},
  author = {Maksim Dzabraev and Maksim Kalashnikov and Stepan Komkov and Aleksandr Petiushko},
  journal= {arXiv preprint arXiv:2103.10699},
  year   = {2021}
}