Hindi Visual Genome:面向多模态英译汉机器翻译的数据集
计算与语言
2019-07-23 v1
摘要
Visual Genome 是一个将结构化图像信息与英语语言相连接的数据集。我们提出“Hindi Visual Genome”,一个由文本与图像组成、适用于英–汉多模态机器翻译任务及多模态研究的多模态数据集。我们从 Visual Genome 中选取简短的英语片段(描述文本)及其关联图像,并借助考虑关联图像的手动后编辑将其自动翻译为印地语。我们准备了 31525 个片段的集合,并附以由 1400 个片段构成的挑战性测试集。该挑战性测试集通过基于嵌入相似度检索(尤其)歧义英语词,并手动筛选那些图像有助于消解歧义的片段而创建。我们的数据集是首个用于多模态英–汉机器翻译的数据集,可免费用于非商业研究目的。我们的印地语版 Visual Genome 亦可用于构建印地语图像标注器或其他实用工具。Hindi Visual Genome 亦服务于 2019 年亚洲翻译研讨会(WAT)的多模态翻译任务。
引用
@article{arxiv.1907.08948,
title = {Hindi Visual Genome: A Dataset for Multimodal English-to-Hindi Machine Translation},
author = {Shantipriya Parida and Ondřej Bojar and Satya Ranjan Dash},
journal= {arXiv preprint arXiv:1907.08948},
year = {2019}
}
备注
6 pages, 3 figures