中文

通过短程推断进行生成式文本建模

机器学习 2021-06-09 v2

摘要

文本的潜变量模型在训练成功时可准确建模数据分布并捕捉句子的全局语义与句法特征。训练此类模型的突出方法是变分自编码器(VAE)。然而其训练具有挑战性,且常陷入平凡局部最优,其中潜变量被忽略、其后验坍缩至先验,此问题称为后验坍缩。已有多种技术被提出以缓解该问题,多数聚焦于改进推断模型以产生更高质量的潜码。本工作提出一种用于推断的短程动力学。它从潜变量的先验分布初始化,然后运行少量(如 20)步由其后验分布引导的朗之万动力学。我们方法的主要优势在于不需要单独的推断模型或假设后验分布的简单几何,从而构成一个自动、自然且灵活的推断引擎。我们表明,与强语言模型和 VAE 基线相比,用短程动力学训练的模型更准确地建模数据,且未显现后验坍缩迹象。对潜空间的分析表明,潜空间中的插值能够生成具有平滑过渡的连贯句子,并较使用无监督预训练潜特征的强基线展现出改进的分类。这些结果共同揭示了我们生成模型的良好结构化潜空间。

关键词

引用

@article{arxiv.2106.02513,
  title  = {Generative Text Modeling through Short Run Inference},
  author = {Bo Pang and Erik Nijkamp and Tian Han and Ying Nian Wu},
  journal= {arXiv preprint arXiv:2106.02513},
  year   = {2021}
}

备注

10 pages