一种用于变分自编码器的促进稀疏性字典模型
机器学习
2022-06-20 v2 声音
音频与语音处理
摘要
在概率深度生成模型(例如变分自编码器,VAEs)中结构化潜空间对于获得更具表达力的模型与可解释表示,并避免过拟合十分重要。实现该目标的一种方式是施加潜变量上的稀疏约束,例如通过 Laplace 先验。然而,此类方法通常使训练阶段复杂化,且为促进稀疏性而牺牲重构质量。本文中,我们提出一种简单而有效的方法,通过促进稀疏性的字典模型来结构化潜空间,该模型假设每个潜码可写为字典各列的稀疏线性组合。特别地,我们借助一种计算高效且无需调参的方法,其依赖于具有可学习方差的零均值高斯潜先验。我们推导了变分推断方案来训练模型。在语音生成建模上的实验展示了所提方法相较竞争技术的优势,因其促进稀疏性同时不损害输出语音质量。
引用
@article{arxiv.2203.15758,
title = {A Sparsity-promoting Dictionary Model for Variational Autoencoders},
author = {Mostafa Sadeghi and Paul Magron},
journal= {arXiv preprint arXiv:2203.15758},
year = {2022}
}
备注
Proc. of Interspeech 2022