中文

VISA:面向视觉场景感知机器翻译的歧义字幕数据集

计算与语言 2022-05-27 v3

摘要

现有的多模态机器翻译(MMT)数据集由图像和视频描述或通用字幕组成,其中很少包含语言歧义,使得视觉信息在生成恰当译文时效果有限。我们提出 VISA,一个包含 4 万日英平行句对及对应视频片段的新数据集,具有以下关键特征:(1)平行句为电影和电视剧中的字幕;(2)源字幕存在歧义,即具有多种含义不同的可能译文;(3)我们根据歧义成因将数据集划分为多义(Polysemy)与省略(Omission)两类。我们表明 VISA 对最新 MMT 系统而言具有挑战性,并希望该数据集能推动 MMT 研究。VISA 数据集可在 https://github.com/ku-nlp/VISA 获取。

关键词

引用

@article{arxiv.2201.08054,
  title  = {VISA: An Ambiguous Subtitles Dataset for Visual Scene-Aware Machine Translation},
  author = {Yihang Li and Shuichiro Shimizu and Weiqi Gu and Chenhui Chu and Sadao Kurohashi},
  journal= {arXiv preprint arXiv:2201.08054},
  year   = {2022}
}

备注

Accepted by LREC2022