用于视频瞬间检索的跨模态对比学习与非对称协同注意力网络
计算机视觉与模式识别
2023-12-13 v1 人工智能
计算与语言
机器学习
摘要
视频瞬间检索是一项具有挑战性的任务,需要视频与文本模态之间进行细粒度的交互。近期在图像-文本预训练中的工作表明,由于视觉序列与文本序列长度上的差异,大多数现有的预训练模型都存在信息不对称的问题。我们质疑在视频-文本领域是否同样存在该问题,同时还需要保留空间和时间信息。因此,我们评估了一种近期提出的解决方案,该方案为视频定位任务添加了非对称协同注意力网络。此外,我们引入了动量对比损失,以便在两种模态中进行鲁棒且具判别性的表示学习。我们注意到,与 TACoS 数据集上的 SOTA 模型相比,这些补充模块的集成带来了更好的性能,并在 ActivityNet Captions 上取得了可比的结果,且所有这些相对于基线都使用了显著更少的参数。
引用
@article{arxiv.2312.07435,
title = {Cross-modal Contrastive Learning with Asymmetric Co-attention Network for Video Moment Retrieval},
author = {Love Panta and Prashant Shrestha and Brabeem Sapkota and Amrita Bhattarai and Suresh Manandhar and Anand Kumar Sah},
journal= {arXiv preprint arXiv:2312.07435},
year = {2023}
}