中文

用于文本生成模型的鸟瞰 Transformer

计算与语言 2022-10-11 v1

摘要

自 Transformer 在机器翻译中取得巨大成功以来,其已成为文本生成模型不可或缺的模块。先前工作将 Transformer 的成功归因于查询-键-值点积注意力,后者通过全连接 token 图提供了鲁棒的归纳偏置。然而,我们发现自注意力存在严重局限。在预测第 (i+1) 个 token 时,自注意力仅将第 i 个 token 作为信息收集器,且倾向于对与自身相似的 token 赋予高注意力权重。因此,发生在第 i 个 token 之前的大部分历史信息未被考虑。基于该观察,本文提出一种称为鸟瞰 Transformer(BET)的新架构,其更进一步通过对自注意力重新加权以鼓励其关注更重要的历史信息,从而提升 Transformer 性能。我们在多个文本生成任务上进行了实验,包括机器翻译(2 个数据集)与语言模型(3 个数据集)。这些实验结果表明,我们所提模型在所有数据集上均取得了优于基线 Transformer 架构的性能。代码发布于:\url{https://sites.google.com/view/bet-transformer/home}。

关键词

引用

@article{arxiv.2210.03985,
  title  = {Bird-Eye Transformers for Text Generation Models},
  author = {Lei Sha and Yuhang Song and Yordan Yordanov and Tommaso Salvatori and Thomas Lukasiewicz},
  journal= {arXiv preprint arXiv:2210.03985},
  year   = {2022}
}