中文

序列生成的迁移学习:从单源到多源

计算与语言 2021-06-01 v1 人工智能

摘要

多源序列生成(MSG)是一类重要的序列生成任务,其接受多个源,包括自动后期编辑、多源翻译、多文档摘要等。由于 MSG 任务受困于数据稀缺问题,且近期预训练模型已被证明对低资源下游任务有效,将预训练的序列到序列模型迁移到 MSG 任务至关重要。尽管直接在 MSG 任务上微调预训练模型并将多个源拼接为单一长序列被视为将预训练模型迁移到 MSG 任务的简单方法,我们推测直接微调方法会导致灾难性遗忘,且仅依赖预训练的自注意力层来捕获跨源信息并不充分。因此,我们提出一种两阶段微调方法以缓解预训练-微调差异,并引入一种带有精细编码器的新型 MSG 模型,以在 MSG 任务中学习更好的表示。实验表明,我们的方法在 WMT17 APE 任务和使用 WMT14 测试集的多源翻译任务上取得了新的 SOTA 结果。当适配到文档级翻译时,我们的框架显著优于强基线。

关键词

引用

@article{arxiv.2105.14809,
  title  = {Transfer Learning for Sequence Generation: from Single-source to Multi-source},
  author = {Xuancheng Huang and Jingfang Xu and Maosong Sun and Yang Liu},
  journal= {arXiv preprint arXiv:2105.14809},
  year   = {2021}
}

备注

ACL2021 main track long paper