MDMMT:用于视频检索的多域多模态 Transformer
计算机视觉与模式识别
2021-11-09 v1
摘要
我们在 MSRVTT 与 LSMDC 基准上的文本到视频检索任务上提出了新的最优结果,我们的模型以大幅优势超越所有先前方案。此外,在无需微调的情况下,单一模型在两个数据集上均达到最优结果。这种多域泛化通过不同视频字幕数据集的恰当组合实现。我们展示在不同数据集上训练可改善彼此的测试结果。另外我们检查了许多流行数据集的交集,发现 MSRVTT 的测试部分与训练部分存在显著重叠,ActivityNet 中也观察到相同情况。
引用
@article{arxiv.2103.10699,
title = {MDMMT: Multidomain Multimodal Transformer for Video Retrieval},
author = {Maksim Dzabraev and Maksim Kalashnikov and Stepan Komkov and Aleksandr Petiushko},
journal= {arXiv preprint arXiv:2103.10699},
year = {2021}
}