中文

插入式语言模型:任意位置插入的序列生成

计算与语言 2025-09-04 v3 机器学习

摘要

自回归模型(ARMs)通过“从左到右”逐个预测后续词元,在广泛的序列生成任务中取得了显著成功。然而,它们难以准确表示需要满足复杂约束的序列,或者那些通过乱序生成能更好处理序列依赖关系的序列。掩码扩散模型(MDMs)解决了其中一些局限性,但在MDMs中同时去掩码多个词元的过程可能会引入不连贯性,并且当待填充的词元数量事先未知时,MDMs无法处理任意的填充约束。在这项工作中,我们引入了Insertion Language Models (ILMs),它们学习在序列的任意位置插入词元——即,它们联合选择要插入的位置和词汇元素。通过一次插入一个词元,ILMs可以表示词元之间的强依赖关系,并且它们以任意顺序生成序列的能力使其能够精确建模词元依赖关系不遵循从左到右顺序结构的序列。为了训练ILMs,我们提出了一种定制的网络参数化方法,并使用一个简单的去噪目标。我们的实证评估表明,ILMs在常见的规划任务上优于ARMs和MDMs。此外,我们展示了ILMs在无条件文本生成任务中优于MDMs,并与ARMs性能相当,同时在任意长度文本填充方面提供了比MDMs更大的灵活性。代码可在以下链接获取:https://dhruveshp.com/projects/ilm。

关键词

引用

@article{arxiv.2505.05755,
  title  = {Insertion Language Models: Sequence Generation with Arbitrary-Position Insertions},
  author = {Dhruvesh Patel and Aishwarya Sahoo and Avinash Amballa and Tahira Naseem and Tim G. J. Rudner and Andrew McCallum},
  journal= {arXiv preprint arXiv:2505.05755},
  year   = {2025}
}

备注

Additional related work. Code available at: https://dhruveshp.com/projects/ilm