FGraDA:机器翻译中细粒度领域自适应的数据集与基准
计算与语言
2021-11-09 v2
摘要
以往将通用神经机器翻译(NMT)模型适配到特定领域的研究通常忽略了同一领域内翻译的多样性,这是现实场景领域适配的核心问题。此类挑战性场景的一个代表是为具有特定主题(例如全球变暖或冠状病毒)的会议部署翻译系统,由于日程有限,通常资源极少。为激励对此类场景的广泛研究,我们提出了一个现实中的机器翻译细粒度领域自适应任务(FGraDA)。FGraDA 数据集包含信息技术四个子领域的中英翻译任务:自动驾驶汽车、AI 教育、实时网络和智能手机。每个子领域都配有用于评估的开发集和测试集。为更贴近现实,FGraDA 未使用任何领域内双语训练数据,而是提供双语词典和维基知识库,这些可在短时间内较容易获取。我们对细粒度领域自适应任务进行了基准测试,并给出深入分析,表明利用异构资源进一步提升性能仍存在挑战性问题。
引用
@article{arxiv.2012.15717,
title = {FGraDA: A Dataset and Benchmark for Fine-Grained Domain Adaptation in Machine Translation},
author = {Wenhao Zhu and Shujian Huang and Tong Pu and Pingxuan Huang and Xu Zhang and Jian Yu and Wei Chen and Yanfeng Wang and Jiajun Chen},
journal= {arXiv preprint arXiv:2012.15717},
year = {2021}
}