中文

面向个性化病理语音增强的变分自编码器

音频与语音处理 2025-03-19 v1 声音

摘要

尽管语音增强(SE)模型在说话人条件下的通用性仍大未被探索,尽管这对更广泛的适用性至关重要。本文考察了混合变分自编码器(VAE)-非负矩阵分解(NMF)模型在SE中的表现,主要关注其对帕金森病患者病理语音的通用性。我们表明,在大型正常神经语音数据集上训练的VAE模型对病理语音表现不佳。尽管通过病理语音进行微调可提升性能,但正常说话人与病理说话人之间仍存在性能差距。为此,我们提出使用从每个说话人仅少量干净数据微调的个性化SE模型。我们的实验结果表明,个性化模型显著提升了所有说话人的性能,使正常说话人和病理说话人的表现相当。

关键词

引用

@article{arxiv.2503.14036,
  title  = {Variational Autoencoder for Personalized Pathological Speech Enhancement},
  author = {Mingchi Hou and Ina Kodrasi},
  journal= {arXiv preprint arXiv:2503.14036},
  year   = {2025}
}

备注

Submitted to EUSIPCO 2025