中文

诱导自然语言推理链与交错标记令牌实现大语言模型的序列外推

计算与语言 2022-11-29 v3

摘要

外推能力,即在比训练样本更长的序列上做出预测的能力,是当前深度学习模型面临的一项挑战。近期研究表明,这一局限在最先进的基于 Transformer 的模型中依然存在。针对该问题的大多数解决方案采用特定架构或训练方法,无法泛化到其他任务。我们证明,大语言模型无需修改其架构或训练过程即可成功实现外推。实验结果表明,生成逐步推理链与引入标记令牌对于有效的外推都是必需的。首先,我们诱导语言模型在输出答案之前产生逐步推理链,以向模型有效传达任务。然而,随着序列变长,我们发现当前模型难以跟踪令牌位置。为解决此问题,我们将输出令牌与充当显式位置与计数符号的标记令牌交错排列。我们的发现展示了这两种互补方法如何实现显著的序列外推,并揭示了当前架构在没有显式表层形式引导时难以有效泛化的局限。代码见 https://github.com/MirelleB/induced-rationales-markup-tokens

关键词

引用

@article{arxiv.2208.11445,
  title  = {Induced Natural Language Rationales and Interleaved Markup Tokens Enable Extrapolation in Large Language Models},
  author = {Mirelle Bueno and Carlos Gemmell and Jeffrey Dalton and Roberto Lotufo and Rodrigo Nogueira},
  journal= {arXiv preprint arXiv:2208.11445},
  year   = {2022}
}