中文

MTVR:视频中的多语言时刻检索

计算与语言 2021-08-03 v1 人工智能 计算机视觉与模式识别

摘要

我们提出 mTVR,一个大规模多语言视频时刻检索数据集,包含来自 21.8K 个电视节目视频片段的 218K 条英文与中文查询。该数据集通过为流行的 TVR 数据集(英文)扩展配对的的中文查询与字幕而构建。与现有时刻检索数据集相比,mTVR 具有多语言、规模更大且带有多样标注的特点。我们进一步提出 mXML,一种在多语言数据上学习并运行的多语言时刻检索模型,通过编码器参数共享与语言邻域约束实现。我们在新收集的 MTVR 数据集上展示了 mXML 的有效性,其以更少参数优于强单语基线。此外,我们还提供了详细的数据集分析与模型消融实验。数据与代码公开于 https://github.com/jayleicn/mTVRetrieval

关键词

引用

@article{arxiv.2108.00061,
  title  = {MTVR: Multilingual Moment Retrieval in Videos},
  author = {Jie Lei and Tamara L. Berg and Mohit Bansal},
  journal= {arXiv preprint arXiv:2108.00061},
  year   = {2021}
}

备注

ACL 2021 (9 pages, 4 figures)