DiffusionRet:基于扩散模型的生成式文本-视频检索
计算机视觉与模式识别
2023-08-22 v2
摘要
现有的文本-视频检索方案本质上是聚焦于最大化条件似然(即 p(candidates|query))的判别模型。尽管直接,这一惯用范式忽略了底层数据分布 p(query),使得识别分布外数据具有挑战性。为应对此局限,我们创造性地以生成视角处理该任务,并将文本与视频之间的相关性建模为它们的联合概率 p(candidates,query)。这通过一种基于扩散的文本-视频检索框架(DiffusionRet)实现,该框架将检索任务建模为从噪声逐步生成联合分布的过程。在训练中,DiffusionRet 从生成与判别两个视角进行优化,生成器由生成损失优化,特征提取器由对比损失训练。以此方式,DiffusionRet 巧妙地利用了生成式与判别式方法的优势。在包括 MSRVTT、LSMDC、MSVD、ActivityNet Captions 和 DiDeMo 在内的五个常用文本-视频检索基准上的大量实验取得了优越性能,证明了我们方法的有效性。更令人鼓舞的是,无需任何修改,DiffusionRet 在域外检索设定下也表现良好。我们相信该工作为相关领域带来根本性见解。代码见 https://github.com/jpthu17/DiffusionRet。
引用
@article{arxiv.2303.09867,
title = {DiffusionRet: Generative Text-Video Retrieval with Diffusion Model},
author = {Peng Jin and Hao Li and Zesen Cheng and Kehan Li and Xiangyang Ji and Chang Liu and Li Yuan and Jie Chen},
journal= {arXiv preprint arXiv:2303.09867},
year = {2023}
}
备注
Accepted by ICCV 2023