序列到序列VAE是否学习了句子的全局特征?
计算与语言
2021-03-30 v2 机器学习
摘要
自回归语言模型功能强大且相对易于训练。然而,这些模型通常在没有显式条件标签的情况下训练,并且不提供在生成过程中控制情感或主题等全局方面的简便方法。Bowman等人(2016)将变分自编码器(VAE)适配于自然语言,采用序列到序列架构,并声称潜在向量能够以无监督方式捕获此类全局特征。我们质疑这一主张。我们通过分解句子中每个位置的重构损失,来衡量哪些词从潜在信息中获益最多。使用该方法,我们发现VAE倾向于记忆首词和句子长度,产生用处有限的局部特征。为缓解此问题,我们研究了基于词袋假设和语言模型预训练的替代架构。这些变体学习到更具全局性的潜在变量,即更能预测主题或情感标签。此外,通过重构,我们观察到它们减少了记忆:首词和句子长度的恢复精度不如基线,从而产生了更多样的重构。
引用
@article{arxiv.2004.07683,
title = {Do sequence-to-sequence VAEs learn global features of sentences?},
author = {Tom Bosc and Pascal Vincent},
journal= {arXiv preprint arXiv:2004.07683},
year = {2021}
}
备注
Camera-ready version, EMNLP2020