KERMIT:基于生成式插入的序列建模
计算与语言
2019-06-05 v1 机器学习
机器学习
摘要
我们提出 KERMIT,一种简单的基于插入的生成式序列及序列对建模方法。KERMIT 使用单一神经网络对联合分布及其分解(即边缘分布与条件分布)建模,且与许多先前工作不同,不依赖于数据分布的预先指定分解。训练时,可输入 KERMIT 配对数据 以学习联合分布 ,并可选择性混入未配对数据 或 以精炼边缘分布 或 。推理时,我们可双向访问条件分布 与 。也可从联合分布或边缘分布采样。该模型支持串行完全自回归解码与并行部分自回归解码,后者经验上呈对数级运行时间。我们通过机器翻译、表示学习和零样本完形填空问答的实验证明,我们的统一方法能在广泛任务上匹配或超越专用的当前最优(SOTA)系统性能,而无需针对问题的架构适配。
引用
@article{arxiv.1906.01604,
title = {KERMIT: Generative Insertion-Based Modeling for Sequences},
author = {William Chan and Nikita Kitaev and Kelvin Guu and Mitchell Stern and Jakob Uszkoreit},
journal= {arXiv preprint arXiv:1906.01604},
year = {2019}
}
备注
William Chan, Nikita Kitaev, Kelvin Guu, and Mitchell Stern contributed equally