中文

跨模态视频检索中多视图嵌入的域适应

计算机视觉与模式识别 2021-10-26 v1 机器学习

摘要

给定一个无字幕视频序列库,本文考虑基于其与未见文本查询的相关性来检索视频的任务。为弥补标注的缺失,我们转而依赖一个由视频-字幕对组成的相关视频库(称为源库),尽管其视频与目标库中的视频之间存在域间隙。因此我们引入了无监督域适应跨模态视频检索问题,以及在一个细粒度动作上的新基准。我们提出了一种通过伪标记目标视频和跨域(即源-目标)排序实现的新型迭代域对齐方法。我们的方法将嵌入空间适应到目标库,持续优于仅源方法以及边缘和条件对齐方法。

关键词

引用

@article{arxiv.2110.12812,
  title  = {Domain Adaptation in Multi-View Embedding for Cross-Modal Video Retrieval},
  author = {Jonathan Munro and Michael Wray and Diane Larlus and Gabriela Csurka and Dima Damen},
  journal= {arXiv preprint arXiv:2110.12812},
  year   = {2021}
}

备注

15 pages