模型权重变化可否用作自带节约多语言 NMT 的准则?
计算与语言
2024-10-08 v1
摘要
许多对一系统在训练数据稀缺时会改进一对一系统。在本文中,我们设计并测试了一种用于选择训练此类系统时 minibatch 语言的新型算法。该算法在模型权重不显著演变时更改 minibatch 语言,这通过测量 Transformer 网络所有层之间的平滑 KL 散度来实现。该算法在翻译质量(以 BLEU 和 COMET 为度量)和收敛速度方面,优于交替使用单语 minibatch的方法,但不如随机混合 minibatch的方法。
引用
@article{arxiv.2410.04147,
title = {Can the Variation of Model Weights be used as a Criterion for Self-Paced Multilingual NMT?},
author = {Àlex R. Atrio and Alexis Allemann and Ljiljana Dolamic and Andrei Popescu-Belis},
journal= {arXiv preprint arXiv:2410.04147},
year = {2024}
}