中文

训练稀疏翻译模型的技巧

计算与语言 2021-10-18 v1

摘要

具有不平衡数据分布的多任务学习会使模型学习偏向高资源任务,尤其在模型容量固定且所有任务完全共享时。稀疏扩展架构(如 BASELayers)为不同任务提供了具有可变参数数量的灵活机制,可用于抵消倾斜的数据分布。我们发现,用于多语言机器翻译的稀疏架构在开箱使用时表现不佳,并提出了两种直接的技术来缓解此问题——温度加热机制和稠密预训练。总体而言,与标准 BASELayers 和 Dense 扩展基线相比,这些方法在两个多语言翻译基准上提升了性能,并且二者结合可将模型收敛速度提高一倍以上。

关键词

引用

@article{arxiv.2110.08246,
  title  = {Tricks for Training Sparse Translation Models},
  author = {Dheeru Dua and Shruti Bhosale and Vedanuj Goswami and James Cross and Mike Lewis and Angela Fan},
  journal= {arXiv preprint arXiv:2110.08246},
  year   = {2021}
}