DaLC:面向神经机器翻译的领域自适应学习曲线预测
计算与语言
2022-04-21 v1 人工智能
摘要
神经机器翻译(NMT)模型的领域自适应(DA)通常依赖于一个预训练的通用NMT模型,该模型在领域内平行数据的样本上被适配到新领域。在没有平行数据的情况下,无法估计DA的潜在收益,也无法估计所需的平行样本数量。然而,这是一种令人期望的功能,可帮助MT从业者在投入资源构建数据集之前做出明智决策。我们提出了一种领域自适应学习曲线预测(DaLC)模型,该模型基于源语言领域内单语样本预测预期的DA性能。我们的模型依赖于NMT编码器表示,并结合了各种实例级和语料库级特征。我们证明,与先前研究提出的语料库级框架相比,实例级更能区分不同领域。最后,我们对结果进行了深入分析,突出了我们方法的局限性,并提供了未来研究方向。
引用
@article{arxiv.2204.09259,
title = {DaLC: Domain Adaptation Learning Curve Prediction for Neural Machine Translation},
author = {Cheonbok Park and Hantae Kim and Ioan Calapodescu and Hyunchang Cho and Vassilina Nikoulina},
journal= {arXiv preprint arXiv:2204.09259},
year = {2022}
}
备注
to be published in ACL2021