基于编码器-解码器 Transformer 的零样本可控生成
计算与语言
2022-04-08 v3 人工智能
摘要
控制基于神经网络的自然语言生成(NLG)模型在机器翻译、文档摘要和对话系统等众多领域有广泛应用。以零样本方式实现此类控制的方法将非常重要,因为除其他原因外,它们消除了对额外标注数据和训练的需求。在这项工作中,我们提出了在零样本下控制基于编码器-解码器 transformer 的 NLG 模型的新方法。这是通过引入三个控制旋钮来实现的,即注意力偏置、解码器混合和上下文增强,它们在生成时应用于这些模型。这些旋钮通过直接操纵训练好的 NLG 模型(例如,偏置交叉注意力层)来控制生成过程,以在生成输出中实现所需属性。我们表明,这些 NLG 模型不仅对 such 操纵具有鲁棒性,而且其行为可以在不影响其生成性能的情况下被控制。据我们所知,这些结果是同类中的首次。通过这些控制旋钮,我们还研究了 transformer 解码器自注意力模块的作用,并展示了强有力的证据,表明其主要作用是维持这些模型生成句子的流畅性。基于这一假设,我们展示了 transformer 解码器的替代架构可能是可行的选项。我们还研究了这一假设如何导致训练编码器-解码器 transformer 模型更高效的方法。
引用
@article{arxiv.2106.06411,
title = {Zero-Shot Controlled Generation with Encoder-Decoder Transformers},
author = {Devamanyu Hazarika and Mahdi Namazifar and Dilek Hakkani-Tür},
journal= {arXiv preprint arXiv:2106.06411},
year = {2022}
}
备注
Accepted at AAAI 2022