中文

KERMIT:基于生成式插入的序列建模

计算与语言 2019-06-05 v1 机器学习 机器学习

摘要

我们提出 KERMIT,一种简单的基于插入的生成式序列及序列对建模方法。KERMIT 使用单一神经网络对联合分布及其分解(即边缘分布与条件分布)建模,且与许多先前工作不同,不依赖于数据分布的预先指定分解。训练时,可输入 KERMIT 配对数据 (x,y)(x, y) 以学习联合分布 p(x,y)p(x, y),并可选择性混入未配对数据 xxyy 以精炼边缘分布 p(x)p(x)p(y)p(y)。推理时,我们可双向访问条件分布 p(xy)p(x \mid y)p(yx)p(y \mid x)。也可从联合分布或边缘分布采样。该模型支持串行完全自回归解码与并行部分自回归解码,后者经验上呈对数级运行时间。我们通过机器翻译、表示学习和零样本完形填空问答的实验证明,我们的统一方法能在广泛任务上匹配或超越专用的当前最优(SOTA)系统性能,而无需针对问题的架构适配。

关键词

引用

@article{arxiv.1906.01604,
  title  = {KERMIT: Generative Insertion-Based Modeling for Sequences},
  author = {William Chan and Nikita Kitaev and Kelvin Guu and Mitchell Stern and Jakob Uszkoreit},
  journal= {arXiv preprint arXiv:1906.01604},
  year   = {2019}
}

备注

William Chan, Nikita Kitaev, Kelvin Guu, and Mitchell Stern contributed equally