中文

动量解码:将开放式文本生成视为图探索

计算与语言 2022-12-06 v1

摘要

基于自回归语言模型(LM)的开放式文本生成是自然语言处理的核心任务之一。然而,基于最大化的解码方法(如贪心/集束搜索)常导致退化问题,即生成的文本不自然且包含不期望的重复。对此问题的现有解决方案要么引入易于不连贯的随机性,要么需要具有额外计算开销的向前看机制。在本研究中,我们从新视角表述开放式文本生成,即将其视为有向图中的探索过程。由此,我们将退化现象理解为有向图中的循环。基于我们的表述,提出了一种新颖的解码方法——\textit{动量解码}——其鼓励 LM \textit{贪心}地探索当前图之外的新节点。同时,它也允许 LM 以被预定义阻力函数降级后的动量返回已有节点。我们在来自不同领域的三个基准上通过自动与人工评估广泛测试了我们的方法。结果表明,动量解码与当前最优水平表现相当,同时享有显著改进的推理速度与计算 FLOPs。此外,我们进行了详细分析以揭示该方法的优点与内在机制。我们的代码及其他相关资源公开于 https://github.com/gmftbyGMFTBY/MomentumDecoding。

关键词

引用

@article{arxiv.2212.02175,
  title  = {Momentum Decoding: Open-ended Text Generation As Graph Exploration},
  author = {Tian Lan and Yixuan Su and Shuhang Liu and Heyan Huang and Xian-Ling Mao},
  journal= {arXiv preprint arXiv:2212.02175},
  year   = {2022}
}

备注

Work in progress