中文

DaLC:面向神经机器翻译的领域自适应学习曲线预测

计算与语言 2022-04-21 v1 人工智能

摘要

神经机器翻译(NMT)模型的领域自适应(DA)通常依赖于一个预训练的通用NMT模型,该模型在领域内平行数据的样本上被适配到新领域。在没有平行数据的情况下,无法估计DA的潜在收益,也无法估计所需的平行样本数量。然而,这是一种令人期望的功能,可帮助MT从业者在投入资源构建数据集之前做出明智决策。我们提出了一种领域自适应学习曲线预测(DaLC)模型,该模型基于源语言领域内单语样本预测预期的DA性能。我们的模型依赖于NMT编码器表示,并结合了各种实例级和语料库级特征。我们证明,与先前研究提出的语料库级框架相比,实例级更能区分不同领域。最后,我们对结果进行了深入分析,突出了我们方法的局限性,并提供了未来研究方向。

关键词

引用

@article{arxiv.2204.09259,
  title  = {DaLC: Domain Adaptation Learning Curve Prediction for Neural Machine Translation},
  author = {Cheonbok Park and Hantae Kim and Ioan Calapodescu and Hyunchang Cho and Vassilina Nikoulina},
  journal= {arXiv preprint arXiv:2204.09259},
  year   = {2022}
}

备注

to be published in ACL2021