SentenceMIM:一种潜变量语言模型
计算与语言
2021-04-23 v5 机器学习
机器学习
摘要
SentenceMIM 是一种用于语言数据的概率自编码器,通过互信息机(MIM)学习训练,以提供变长语言观测(即类似于 VAE)的固定长度表示。先前学习语言数据 VAE 的尝试因后验坍缩而面临挑战。MIM 学习鼓励观测与潜变量间的高互信息,并对后验坍缩具有鲁棒性。因此,它学习到的信息性表示其维度可高于现有语言 VAE 一个数量级。重要的是,SentenceMIM 损失无超参数,简化了优化。我们在多个数据集上将 sentenceMIM 与 VAE 及 AE 比较。SentenceMIM 取得优异重建,可与 AE 媲美,并具有可与 VAE 相比的丰富结构化潜空间。该结构化潜表示通过不同长度句子间的插值得以展示。我们通过在无需微调的情况下将训练模型用于问答与迁移学习,展示了 sentenceMIM 的通用性,其性能优于具有相似架构的 VAE 与 AE。
引用
@article{arxiv.2003.02645,
title = {SentenceMIM: A Latent Variable Language Model},
author = {Micha Livne and Kevin Swersky and David J. Fleet},
journal= {arXiv preprint arXiv:2003.02645},
year = {2021}
}
备注
Preprint. Demo: https://github.com/seraphlabs-ca/SentenceMIM-demo