在自然语言生成中弥合预训练-微调范式下的子词鸿沟
计算与语言
2021-06-14 v1
摘要
预训练-微调范式的一个众所周知的限制在于其由一刀切词表带来的不灵活性。这可能在将预训练模型应用于自然语言生成(NLG)任务时削弱效果,尤其是对于上游与下游任务之间具有显著差异的子词分布。为着手解决该问题,我们用一个额外的嵌入迁移步骤扩展了原始的预训练-微调流程。具体而言,引入一个即插即用的嵌入生成器,根据其形态相似词的预训练嵌入来生成任何输入词的表示。因此,下游任务中不匹配词的嵌入也可被高效初始化。我们在预训练-微调方式下的多种 NLG 任务上进行了实验。实验结果和广泛分析表明,所提策略为我们提供了自由迁移词表的机会,从而带来更高效且性能更优的下游 NLG 模型。
引用
@article{arxiv.2106.06125,
title = {Bridging Subword Gaps in Pretrain-Finetune Paradigm for Natural Language Generation},
author = {Xin Liu and Baosong Yang and Dayiheng Liu and Haibo Zhang and Weihua Luo and Min Zhang and Haiying Zhang and Jinsong Su},
journal= {arXiv preprint arXiv:2106.06125},
year = {2021}
}
备注
Accepted by ACL2021