面向个性化病理语音增强的变分自编码器
音频与语音处理
2025-03-19 v1 声音
摘要
尽管语音增强(SE)模型在说话人条件下的通用性仍大未被探索,尽管这对更广泛的适用性至关重要。本文考察了混合变分自编码器(VAE)-非负矩阵分解(NMF)模型在SE中的表现,主要关注其对帕金森病患者病理语音的通用性。我们表明,在大型正常神经语音数据集上训练的VAE模型对病理语音表现不佳。尽管通过病理语音进行微调可提升性能,但正常说话人与病理说话人之间仍存在性能差距。为此,我们提出使用从每个说话人仅少量干净数据微调的个性化SE模型。我们的实验结果表明,个性化模型显著提升了所有说话人的性能,使正常说话人和病理说话人的表现相当。
引用
@article{arxiv.2503.14036,
title = {Variational Autoencoder for Personalized Pathological Speech Enhancement},
author = {Mingchi Hou and Ina Kodrasi},
journal= {arXiv preprint arXiv:2503.14036},
year = {2025}
}
备注
Submitted to EUSIPCO 2025