文本即 MASS:用于文本-视频检索的随机嵌入建模
计算机视觉与模式识别
2024-03-28 v1
摘要
视频片段的日益普及促使对文本-视频检索日益关注。近期进展聚焦于建立文本和视频的联合嵌入空间,依赖一致的嵌入表示来计算相似度。然而,现有数据集中的文本内容通常简短且浓缩,难以完全描述视频的冗余语义。相应地,单个文本嵌入可能捕获视频嵌入并实现检索的表达力不足。本研究提出一种新的随机文本建模方法 T-MASS,即将文本建模为随机嵌入,以灵活且具韧性的语义范围丰富文本嵌入,形成文本质量。具体而言,我们引入一种基于相似度的半径模块,以适应文本质量的规模应用于给定的文本-视频对。此外,我们设计并开发一种支持文本正则化,以进一步控制训练过程中的文本质量。还量身定制推理管道,以充分利用文本质量实现精准检索。实证证据表明,T-MASS不仅有效地吸引相关文本-视频对,同时将不相关的文本-视频对置于距离之外,还能为相关配对确定精确的文本嵌入。我们的实验结果显示,T-MASS 在基线上实现了显著的改进(R@1 提升 3%至 6.3%)。此外,T-MASS 在包括 MSRVTT、LSMDC、DiDeMo、VATEX 和 Charades 在内的五个基准数据集上实现了最先进的性能。
引用
@article{arxiv.2403.17998,
title = {Text Is MASS: Modeling as Stochastic Embedding for Text-Video Retrieval},
author = {Jiamian Wang and Guohao Sun and Pichao Wang and Dongfang Liu and Sohail Dianat and Majid Rabbani and Raghuveer Rao and Zhiqiang Tao},
journal= {arXiv preprint arXiv:2403.17998},
year = {2024}
}
备注
Accepted by CVPR 2024, code and model are available at https://github.com/Jiamian-Wang/T-MASS-text-video-retrieval