UATVR:不确定性自适应文本-视频检索
计算机视觉与模式识别
2023-08-22 v2
摘要
随着网络视频的爆炸式增长以及大规模视觉-语言预训练模型(如 CLIP)的出现,利用文本指令检索感兴趣视频受到了越来越多的关注。一种常见做法是将文本-视频对映射到同一嵌入空间,并以特定粒度对特定实体构建跨模态交互以实现语义对应。遗憾的是,对于跨模态查询而言,在适当粒度下最优实体组合所固有的不确定性研究不足,这对于具有层次化语义的模态(如视频、文本等)尤为关键。本文中,我们提出了一种不确定性自适应文本-视频检索方法,称为 UATVR,该方法将每次查找建模为分布匹配过程。具体而言,我们在编码器中添加额外的可学习 token,以自适应聚合多粒度语义,实现灵活的高层推理。在精炼后的嵌入空间中,我们将文本-视频对表示为概率分布,并采样原型用于匹配评估。在四个基准上的综合实验证明了我们 UATVR 的优越性,其在 MSR-VTT(50.8%)、VATEX(64.5%)、MSVD(49.7%)和 DiDeMo(45.8%)上取得了新的最先进结果。代码见 https://github.com/bofang98/UATVR。
引用
@article{arxiv.2301.06309,
title = {UATVR: Uncertainty-Adaptive Text-Video Retrieval},
author = {Bo Fang and Wenhao Wu and Chang Liu and Yu Zhou and Yuxin Song and Weiping Wang and Xiangbo Shu and Xiangyang Ji and Jingdong Wang},
journal= {arXiv preprint arXiv:2301.06309},
year = {2023}
}
备注
To appear at ICCV2023