中文

VTC:利用用户评论改进视频–文本检索

计算机视觉与模式识别 2022-10-21 v1 计算与语言 信息检索 机器学习

摘要

多模态检索对推荐和搜索等诸多应用而言是一个重要问题。当前的基准乃至数据集通常经人工构建,且大多由所有模态与内容高度相关的干净样本组成。因此,当前的视频–文本检索研究主要聚焦于视频标题或音频转录文本,而忽略用户评论,因为用户往往倾向于讨论仅与视频 vaguely 相关的主题。尽管用户评论在网络上无处不在,目前尚无包含评论的多模态表示学习数据集。在本文中,我们 a) 引入一个包含视频、标题与评论的新数据集;b) 提出一种基于注意力的机制,使模型能够从评论等有时无关的数据中学习;c) 表明通过使用评论,我们的方法能够为图像、视频和音频表示学习到更好、更具上下文的表示。项目页面:https://unitaryai.github.io/vtc-paper。

关键词

引用

@article{arxiv.2210.10820,
  title  = {VTC: Improving Video-Text Retrieval with User Comments},
  author = {Laura Hanu and James Thewlis and Yuki M. Asano and Christian Rupprecht},
  journal= {arXiv preprint arXiv:2210.10820},
  year   = {2022}
}

备注

Accepted paper at the European Conference on Computer Vision (ECCV) 2022