中文

VQalAttent:基于 Transformer 学习的 VQ-VAE 潜在空间的透明语音生成管线

机器学习 2024-11-25 v1 音频与语音处理

摘要

生成高质量语音的效率仍是语音合成中生成模型的关键挑战。本文介绍了 VQalAttent,一个旨在生成可调性能率和可解释性的轻量级模型。利用由 AudioMNIST 数据集提供的语音数据(包含人类说出的十进制数字 0-9),我们的方法采用两步架构:首先,一个可扩展向量量化自编码器 (VQ-VAE) 将音频频谱图压缩为离散潜在表示;其次,一个仅使用解码器的 Transformer 学习这些潜在变量的概率模型。经过训练的 Transformer 生成类似的潜在序列,这些序列可由 VQ-VAE 解码器转换为音频频谱图,从而生成假发音。通过解读这些假发音的统计和感知质量(取决于潜在空间的维度和外部信息),可实现对更大规模商业生成模型的引导式改进。作为理解和细化音频合成的有价值工具,我们的结果表明 VQalAttent 能够在有限的计算资源下生成可理解的语音样本,同时该训练管线的模块化和透明度有助于轻松关联分析与模块化修改,从而为更复杂的模型提供见解。

关键词

引用

@article{arxiv.2411.14642,
  title  = {VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space},
  author = {Armani Rodriguez and Silvija Kokalj-Filipovic},
  journal= {arXiv preprint arXiv:2411.14642},
  year   = {2024}
}