基于有监督稀疏多粒度学习的视频-文本检索
计算机视觉与模式识别
2023-10-19 v2 计算与语言
信息检索
机器学习
多媒体
摘要
尽管近期视频-文本检索的进展得益于对更优表示学习的探索,但在本文中,我们提出了一种新颖的多粒度稀疏学习框架S3MA,旨在学习视频与文本之间共享的对齐稀疏空间以用于视频-文本检索。该共享稀疏空间由有限数量的稀疏概念初始化,每个概念指向若干词语。借助手头的文本数据,我们使用所提出的相似度和对齐损失以有监督的方式学习和更新该共享稀疏空间。此外,为实现多粒度对齐,我们融入了帧表示以更好地建模视频模态并计算细粒度和粗粒度相似度。受益于学习到的共享稀疏空间和多粒度相似度,在多个视频-文本检索基准上的广泛实验证明了S3MA相较于现有方法的优越性。我们的代码可在https://github.com/yimuwangcs/Better_Cross_Modal_Retrieval获取。
引用
@article{arxiv.2302.09473,
title = {Video-Text Retrieval by Supervised Sparse Multi-Grained Learning},
author = {Yimu Wang and Peng Shi},
journal= {arXiv preprint arXiv:2302.09473},
year = {2023}
}
备注
Findings of EMNLP 2023