口语语言对使用自监督语音表征损失函数的语音增强的影响
音频与语音处理
2023-10-23 v2 机器学习
声音
摘要
近期语音增强(SE)领域的工作涉及使用自监督语音表征(SSSRs)作为损失函数中的特征变换。然而,在先前工作中,很少有人关注用于训练自监督表征的音频语言与用于训练 SE 系统的语言之间的关系。使用损失函数(其中融入的自监督表征与用于训练 SE 系统的噪声数据语言完全一致)训练的增强模型,比不一致者表现更好。这可能导致增强系统具有语言特异性,从而不能很好地泛化到未见过的语言,而不像使用传统谱图或时域损失函数训练的模型。本工作中,SE 模型在多种不同语言上训练与测试,所采用的自监督表征本身使用不同的语言组合和不同的网络结构作为损失函数表征进行训练。随后这些模型在未见语言上测试并分析其性能。研究发现,自监督表征的训练语言对增强性能似乎影响甚微,但特定语言的训练数据量却极大影响性能。
引用
@article{arxiv.2307.14502,
title = {The Effect of Spoken Language on Speech Enhancement using Self-Supervised Speech Representation Loss Functions},
author = {George Close and Thomas Hain and Stefan Goetze},
journal= {arXiv preprint arXiv:2307.14502},
year = {2023}
}
备注
Accepted at WASPAA 2023