ProTA:用于文本-视频检索的概率化标记聚合
计算机视觉与模式识别
2024-04-23 v2
摘要
文本-视频检索旨在为给定查询找到最相关的跨模态样本。最近的方法侧重于建模整个空间-时间关系。然而,由于视频剪辑包含的内容比标题更为多样,模型对齐这些非对称的视频文本对有很大概率检索出许多误报结果。本文提出概率化标记聚合(ProTA)来处理具有内容不对称性的跨模态交互。具体而言,我们提出双部分相关聚合,以在低维和高维空间中分离和重新聚合标记表示。我们提出基于标记的概率对齐,以生成标记级别的概率表示并保持特征表示的多样性。此外,提出了自适应对比损失以学习紧凑的跨模态分布空间。基于大量实验,ProTA在MSR-VTT(50.9%)、LSMDC(25.8%)和DiDeMo(47.2%)上实现了显著的改进。
引用
@article{arxiv.2404.12216,
title = {ProTA: Probabilistic Token Aggregation for Text-Video Retrieval},
author = {Han Fang and Xianghao Zang and Chao Ban and Zerun Feng and Lanxiang Zhou and Zhongjiang He and Yongxiang Li and Hao Sun},
journal= {arXiv preprint arXiv:2404.12216},
year = {2024}
}