跨模态视频检索中多视图嵌入的域适应
计算机视觉与模式识别
2021-10-26 v1 机器学习
摘要
给定一个无字幕视频序列库,本文考虑基于其与未见文本查询的相关性来检索视频的任务。为弥补标注的缺失,我们转而依赖一个由视频-字幕对组成的相关视频库(称为源库),尽管其视频与目标库中的视频之间存在域间隙。因此我们引入了无监督域适应跨模态视频检索问题,以及在一个细粒度动作上的新基准。我们提出了一种通过伪标记目标视频和跨域(即源-目标)排序实现的新型迭代域对齐方法。我们的方法将嵌入空间适应到目标库,持续优于仅源方法以及边缘和条件对齐方法。
引用
@article{arxiv.2110.12812,
title = {Domain Adaptation in Multi-View Embedding for Cross-Modal Video Retrieval},
author = {Jonathan Munro and Michael Wray and Diane Larlus and Gabriela Csurka and Dima Damen},
journal= {arXiv preprint arXiv:2110.12812},
year = {2021}
}
备注
15 pages