中文

SentenceMIM:一种潜变量语言模型

计算与语言 2021-04-23 v5 机器学习 机器学习

摘要

SentenceMIM 是一种用于语言数据的概率自编码器,通过互信息机(MIM)学习训练,以提供变长语言观测(即类似于 VAE)的固定长度表示。先前学习语言数据 VAE 的尝试因后验坍缩而面临挑战。MIM 学习鼓励观测与潜变量间的高互信息,并对后验坍缩具有鲁棒性。因此,它学习到的信息性表示其维度可高于现有语言 VAE 一个数量级。重要的是,SentenceMIM 损失无超参数,简化了优化。我们在多个数据集上将 sentenceMIM 与 VAE 及 AE 比较。SentenceMIM 取得优异重建,可与 AE 媲美,并具有可与 VAE 相比的丰富结构化潜空间。该结构化潜表示通过不同长度句子间的插值得以展示。我们通过在无需微调的情况下将训练模型用于问答与迁移学习,展示了 sentenceMIM 的通用性,其性能优于具有相似架构的 VAE 与 AE。

关键词

引用

@article{arxiv.2003.02645,
  title  = {SentenceMIM: A Latent Variable Language Model},
  author = {Micha Livne and Kevin Swersky and David J. Fleet},
  journal= {arXiv preprint arXiv:2003.02645},
  year   = {2021}
}

备注

Preprint. Demo: https://github.com/seraphlabs-ca/SentenceMIM-demo