基于分层 Transformer 动态变分自编码器的语音建模
音频与语音处理
2023-05-11 v2 机器学习
声音
摘要
动态变分自编码器(DVAEs)是一类潜变量深度生成模型,它将 VAE 扩展为对观测数据序列及相应的潜向量序列进行建模。在现有文献中,几乎所有 DVAE 都在每个序列内部及两个序列之间使用循环神经网络来建模时间依赖关系。本文提出使用分层 Transformer 动态变分自编码器(HiT-DVAE)对语音信号进行建模,该模型具有两级潜变量(序列级与帧级),并利用 Transformer 架构实现时间依赖关系。我们表明,在语音谱图建模方面,HiT-DVAE 优于多种其他 DVAE,同时训练过程更为简单,展现出其在语音增强等下游底层语音处理任务中的巨大潜力。
引用
@article{arxiv.2303.09404,
title = {Speech Modeling with a Hierarchical Transformer Dynamical VAE},
author = {Xiaoyu Lin and Xiaoyu Bie and Simon Leglaive and Laurent Girin and Xavier Alameda-Pineda},
journal= {arXiv preprint arXiv:2303.09404},
year = {2023}
}