中文

分析对话回复模型预训练-微调中的遗忘问题

计算与语言 2021-01-19 v5 人工智能 机器学习

摘要

在这项工作中,我们研究了预训练-微调框架中的微调阶段如何改变预训练神经语言生成器的行为。我们聚焦于用于开放域对话回复生成任务的 Transformer 编码器-解码器模型。我们的主要发现是,经过标准微调后,模型会遗忘在大规模预训练期间获得的一些重要语言生成技能。我们通过从知识迁移、上下文敏感性和函数空间投影的角度进行的一系列详细行为分析,展示了这种遗忘现象。作为缓解遗忘问题的初步尝试,我们提出了一种名为“混合回顾(mix-review)”的直观微调策略。我们发现混合回顾有效地正则化了微调过程,并在一定程度上缓解了遗忘问题。最后,我们讨论了所得对话模型的有趣行为及其启示。

关键词

引用

@article{arxiv.1910.07117,
  title  = {Analyzing the Forgetting Problem in the Pretrain-Finetuning of Dialogue Response Models},
  author = {Tianxing He and Jun Liu and Kyunghyun Cho and Myle Ott and Bing Liu and James Glass and Fuchun Peng},
  journal= {arXiv preprint arXiv:1910.07117},
  year   = {2021}
}