面向条件语言生成的编码器无关自适应
计算与语言
2019-09-12 v2
摘要
大型预训练语言模型改变了研究者处理判别性自然语言理解任务的方式,使得适配预训练模型至任意下游任务的方法占据主导。然而,如何将类似技术用于语言生成仍是一个开放问题。在编码器无关设定下的早期结果大多是负面的。在这项工作中,我们探索将预训练语言模型适配至任意条件输入的方法。我们观察到预训练的 transformer 模型在调优过程中对大参数变化敏感。因此我们提出一种自适应方法,将任意条件直接注入自注意力中,我们称之为伪自注意力(pseudo self attention)。通过在四个不同的条件文本生成任务上的实验,我们表明这种编码器无关技术优于强基线,生成连贯文本,并且数据高效。
引用
@article{arxiv.1908.06938,
title = {Encoder-Agnostic Adaptation for Conditional Language Generation},
author = {Zachary M. Ziegler and Luke Melas-Kyriazi and Sebastian Gehrmann and Alexander M. Rush},
journal= {arXiv preprint arXiv:1908.06938},
year = {2019}
}