中文

通过 Metropolis–Hastings 揭示掩码语言模型背后的隐式能量网络

机器学习 2022-03-16 v2 计算与语言

摘要

尽管近期工作表明,通过 ubiquitous 的掩码语言建模(MLM)目标训练的模型给出的分数能有效区分可能与不可能的序列,但这些 MLM 是否规定了覆盖可能序列空间的原则性概率分布仍属开放问题。本文将 MLM 解释为基于能量的序列模型,并提出两种可从训练好的 MLM 导出的能量参数化。为从这些模型正确采样,我们基于 Metropolis–Hastings 蒙特卡洛算法开发了可处理的采样方案。在我们的方法中,提议样本取自训练掩码语言模型所用的相同掩码条件分布,并依据目标分布按其能量值接受或拒绝。我们通过开放端无条件生成与机器翻译条件生成任务上从这些基于能量的模型抽取样本的质量探索,验证了所提参数化的有效性。我们从理论与经验上论证了采样算法:表明单独的掩码条件分布并不产生平稳分布为我们目标分布的马尔可夫链,且我们的方法比其他近期提出的无向生成方法(Wang et al., 2019, Ghazvininejad et al., 2019)生成更高质量样本。

关键词

引用

@article{arxiv.2106.02736,
  title  = {Exposing the Implicit Energy Networks behind Masked Language Models via Metropolis--Hastings},
  author = {Kartik Goyal and Chris Dyer and Taylor Berg-Kirkpatrick},
  journal= {arXiv preprint arXiv:2106.02736},
  year   = {2022}
}

备注

ICLR 2022 - camera ready