面向低资源语料挖掘的更优质量估计
计算与语言
2022-03-17 v1 人工智能
摘要
质量估计(QE)模型有潜力改变我们评估甚至训练机器翻译模型的方式。然而,这些模型仍缺乏实现广泛采用的鲁棒性。我们表明,最先进的QE模型在并行语料挖掘(PCM)设定下测试时,由于对分布外样本缺乏鲁棒性而表现异常糟糕。我们提出一种多任务训练、数据增强与对比学习的组合以实现更好且更鲁棒的QE性能。我们展示了我们的方法在MLQE挑战赛中提升了QE性能,并提升了QE模型在并行语料挖掘设定下测试时的鲁棒性。我们将PCM中的准确率提升了超过0.80,使其与使用数百万句对训练模型的先进PCM方法相当。相比之下,我们使用了少一千倍的数据,总计7K平行句,并提出了一种新颖的低资源PCM方法。
引用
@article{arxiv.2203.08259,
title = {Better Quality Estimation for Low Resource Corpus Mining},
author = {Muhammed Yusuf Kocyigit and Jiho Lee and Derry Wijaya},
journal= {arXiv preprint arXiv:2203.08259},
year = {2022}
}
备注
To be published in: Findigs of ACL2022. 9 Pages + Appendix