T2VParser:用于文本到视频检索中部分对齐的自适应分解标记
计算机视觉与模式识别
2025-07-29 v1 多媒体
摘要
文本到视频检索本质上旨在训练模型准确地将视觉内容与文本描述对齐。由于图像-文本预训练模型如 CLIP 所展示的卓越通用多模态知识,现有工作主要致力于扩展 CLIP 知识以适用于视频-文本任务。然而,视频通常包含比图像更丰富的信息。在当前视频-文本数据集中,文本描述只能反映视频内容的部分内容,导致视频-文本匹配中的部分错位。因此,直接将文本表示与视频表示对齐会导致错误的监督,忽略信息的不等价性。本文提出 T2VParser,通过从文本和视频中提取多视图语义表示,实现自适应语义对齐,而非对齐整个表示。为从不同模态中提取相应表示,我们引入自适应分解标记(Adaptive Decomposition Tokens),由一组跨模态共享的可学习标记组成。T2VParser 的目标是在保持预训练模型知识的同时,强调文本和视频之间的精确对齐。实验结果表明,T2VParser 通过有效的跨模态内容分解实现了准确的部分对齐。代码已公开于 https://github.com/Lilidamowang/T2VParser。
引用
@article{arxiv.2507.20518,
title = {T2VParser: Adaptive Decomposition Tokens for Partial Alignment in Text to Video Retrieval},
author = {Yili Li and Gang Xiong and Gaopeng Gou and Xiangyan Qu and Jiamin Zhuang and Zhen Li and Junzheng Shi},
journal= {arXiv preprint arXiv:2507.20518},
year = {2025}
}