中文

一种用于变分自编码器的促进稀疏性字典模型

机器学习 2022-06-20 v2 声音 音频与语音处理

摘要

在概率深度生成模型(例如变分自编码器,VAEs)中结构化潜空间对于获得更具表达力的模型与可解释表示,并避免过拟合十分重要。实现该目标的一种方式是施加潜变量上的稀疏约束,例如通过 Laplace 先验。然而,此类方法通常使训练阶段复杂化,且为促进稀疏性而牺牲重构质量。本文中,我们提出一种简单而有效的方法,通过促进稀疏性的字典模型来结构化潜空间,该模型假设每个潜码可写为字典各列的稀疏线性组合。特别地,我们借助一种计算高效且无需调参的方法,其依赖于具有可学习方差的零均值高斯潜先验。我们推导了变分推断方案来训练模型。在语音生成建模上的实验展示了所提方法相较竞争技术的优势,因其促进稀疏性同时不损害输出语音质量。

关键词

引用

@article{arxiv.2203.15758,
  title  = {A Sparsity-promoting Dictionary Model for Variational Autoencoders},
  author = {Mostafa Sadeghi and Paul Magron},
  journal= {arXiv preprint arXiv:2203.15758},
  year   = {2022}
}

备注

Proc. of Interspeech 2022