中文

VATEX:用于视频与语言研究的大规模高质量多语言数据集

计算机视觉与模式识别 2020-06-18 v3 计算与语言 机器学习

摘要

我们提出一个新的大规模多语言视频描述数据集 VATEX,其包含超过 41,250 个视频以及英汉双语共 825,000 条字幕。在这些字幕中,有超过 206,000 个英中平行翻译对。与广泛使用的 MSR-VTT 数据集相比,VATEX 具有多语言性、规模更大、语言更复杂,并且在视频和自然语言描述两方面都更具多样性。我们还基于 VATEX 引入了两项视频与语言研究的任务:(1)多语言视频字幕生成,旨在用紧凑的统一字幕模型以多种语言描述视频;(2)视频引导机器翻译,利用视频信息作为额外的时空上下文将源语言描述翻译为目标语言。在 VATEX 数据集上的大量实验表明,首先,统一的多语言模型不仅能更高效地生成视频的英文和中文描述,而且相较单语言模型提供了改进的性能。此外,我们证明时空视频上下文可被有效用于对齐源语言与目标语言,从而辅助机器翻译。最后,我们讨论了使用 VATEX 进行其他视频与语言研究的潜力。

关键词

引用

@article{arxiv.1904.03493,
  title  = {VATEX: A Large-Scale, High-Quality Multilingual Dataset for Video-and-Language Research},
  author = {Xin Wang and Jiawei Wu and Junkun Chen and Lei Li and Yuan-Fang Wang and William Yang Wang},
  journal= {arXiv preprint arXiv:1904.03493},
  year   = {2020}
}

备注

ICCV 2019 Oral. 17 pages, 14 figures, 6 tables (updated the VATEX website link: vatex-challenge.org)