利用上下文宽音类信息提升语音增强性能
声音
2023-06-21 v5 机器学习
音频与语音处理
摘要
先前研究已证实,通过将发音特征的位置/方式增补至声学特征,可引导语音增强(SE)过程在施行增强时考量输入语音的宽音类属性,从而获得性能提升。本文中,我们探索将发音属性的上下文信息作为附加信息以进一步裨益 SE。更具体地,我们提出利用来自端到端自动语音识别(E2E-ASR)模型的损失来预测宽音类(BPC)序列,从而提升 SE 性能。我们还基于 BPC 的 E2E-ASR 开发了带 ASR 与感知损失的多目标训练以训练 SE 系统。来自语音去噪、语音去混响及受损语音增强任务的实验结果证实,上下文 BPC 信息改善了 SE 性能。此外,以 BPC 基 E2E-ASR 训练的 SE 模型优于以音素基 E2E-ASR 训练的模型。结果表明,ASR 系统对音素的误分类目标可能导致不完美反馈,而 BPC 或是更优选择。最后指出,在计算附加目标时将最易混淆的音素目标归并至同一 BPC 可有效提升 SE 性能。
引用
@article{arxiv.2011.07442,
title = {Improving Speech Enhancement Performance by Leveraging Contextual Broad Phonetic Class Information},
author = {Yen-Ju Lu and Chia-Yu Chang and Cheng Yu and Ching-Feng Liu and Jeih-weih Hung and Shinji Watanabe and Yu Tsao},
journal= {arXiv preprint arXiv:2011.07442},
year = {2023}
}
备注
To appear in IEEE Transactions on Audio, Speech and Language Processing (TASLP)