ConTra:用于跨模态视频检索的(上下文)Transformer
计算机视觉与模式识别
2022-10-11 v1
摘要
本文重新审视跨模态片段-句子检索任务,其中片段来自较长未剪辑视频的一部分。当片段较短或视觉上含混时,利用其局部时间上下文(即周围视频段)可改善检索性能。我们提出上下文Transformer(ConTra):一种对视频片段与其局部时间上下文之间的交互建模从而增强其嵌入表示的编码器架构。重要的是,我们使用跨模态嵌入空间中的对比损失来监督该上下文Transformer。我们探讨了用于视频与文本模态的上下文Transformer。结果在三个数据集上一致显示出性能提升:YouCook2、EPIC-KITCHENS以及ActivityNet Captions的片段-句子版本。详尽的消融研究与上下文分析表明了所提方法的有效性。
引用
@article{arxiv.2210.04341,
title = {ConTra: (Con)text (Tra)nsformer for Cross-Modal Video Retrieval},
author = {Adriano Fragomeni and Michael Wray and Dima Damen},
journal= {arXiv preprint arXiv:2210.04341},
year = {2022}
}
备注
Accepted in ACCV 2022