DREAM:利用基于相关性的增强和大型基础模型改进视频-文本检索
计算机视觉与模式识别
2025-02-05 v2 计算与语言
信息检索
机器学习
摘要
视频-文本检索的最新进展主要得益于模型架构和训练策略的进步。然而,视频-文本检索模型的表示学习能力仍受限于低质量且有限的训练数据标注。为解决这一问题,我们提出了一种基于相关性的增强的新型视频-文本检索范式,即 DREAM,它利用大型基础模型增强视频和文本数据,以学习更具泛化性的特征。具体而言,我们首先采用一种简单的增强方法,通过随机复制或丢弃子词和帧来生成自相似数据。此外,受视觉和语言生成模型最新进展的启发,我们提出了一种更鲁棒的增强方法,利用大型语言模型(LLMs)和视觉生成模型(VGMs)进行文本改写和视频风格化。为了进一步丰富视频和文本信息,我们提出了一种基于相关性的增强方法,其中 LLMs 和 VGMs 生成新的相关信息并将其整合到原始数据中。利用这些增强后的数据,在多个视频-文本检索基准上的大量实验证明了 DREAM 优于现有方法。
引用
@article{arxiv.2404.05083,
title = {DREAM: Improving Video-Text Retrieval Through Relevance-Based Augmentation Using Large Foundation Models},
author = {Yimu Wang and Shuai Yuan and Bo Xue and Xiangru Jian and Wei Pang and Mushi Wang and Ning Yu},
journal= {arXiv preprint arXiv:2404.05083},
year = {2025}
}
备注
NAACL 2025