中文

Semformer:具有语义规划的Transformer语言模型

计算与语言 2024-10-28 v1

摘要

下一个词元预测是当前神经语言模型中的主导组成部分。在训练阶段,模型采用教师强制,即基于所有先前的真实词元来预测词元。然而,这种方法被发现会产生捷径,利用已揭示的前缀来虚假地拟合未来的词元,这可能会损害下一个词元预测器的准确性。在本文中,我们介绍了Semformer,这是一种训练Transformer语言模型的新方法,它显式地对响应的语义规划进行建模。具体来说,我们将一系列规划词元整合到前缀中,引导规划词元的表示来预测响应的潜在语义表示,这些表示由一个自编码器诱导产生。在一个最小规划任务(即图路径查找)中,我们的模型表现出近乎完美的性能,并有效缓解了捷径学习,这是标准训练方法和基线模型无法做到的。此外,我们从头开始预训练了一个具有1.25亿参数的Semformer,通过困惑度、上下文学习以及在摘要任务上的微调等指标证明了其有效性。

关键词

引用

@article{arxiv.2409.11143,
  title  = {Semformer: Transformer Language Models with Semantic Planning},
  author = {Yongjing Yin and Junran Ding and Kai Song and Yue Zhang},
  journal= {arXiv preprint arXiv:2409.11143},
  year   = {2024}
}