中文

仅解码器还是编码器-解码器?将语言模型解释为正则化编码器-解码器

计算与语言 2023-04-11 v1 人工智能 机器学习

摘要

序列到序列(seq2seq)任务旨在基于给定的输入源序列生成目标序列。传统上,大多数 seq2seq 任务由编码器-解码器框架解决,该框架需要编码器编码源序列并由解码器生成目标文本。近来,出现了一批将仅解码器语言模型直接应用于 seq2seq 任务的新方法。尽管将语言模型应用于 seq2seq 任务取得了显著进展,仍缺乏对仅解码器语言模型架构有效性的透彻分析。本文旨在通过正则化编码器-解码器结构的分析,对编码器-解码器架构与仅解码器语言模型框架进行详细比较,以填补这一空白。该结构旨在复现经典仅解码器语言模型的所有行为,但具有编码器与解码器,从而更易于与经典编码器-解码器结构比较。基于分析,我们揭示了语言模型中的注意力退化问题,即随着生成步数增加,对源序列的注意力越来越少。为定量理解该问题,我们对注意力输出相对于源输入进行了理论敏感性分析。基于我们的分析,我们提出了一种新颖的部分注意力语言模型以解决注意力退化问题。在机器翻译、摘要和数据到文本生成任务上的实验结果支持我们的分析并证明了所提模型的有效性。

关键词

引用

@article{arxiv.2304.04052,
  title  = {Decoder-Only or Encoder-Decoder? Interpreting Language Model as a Regularized Encoder-Decoder},
  author = {Zihao Fu and Wai Lam and Qian Yu and Anthony Man-Cho So and Shengding Hu and Zhiyuan Liu and Nigel Collier},
  journal= {arXiv preprint arXiv:2304.04052},
  year   = {2023}
}