语音增强中音素感知技术的系统性比较
音频与语音处理
2022-06-23 v1 机器学习
声音
摘要
近年来,端到端神经网络的使用使语音增强取得了巨大进步。然而,大多数模型对所说音素内容是不可知的。最近,若干研究提出了音素感知语音增强,大多采用感知监督。但在模型优化过程中注入音素特征还可采取其他形式(例如模型条件化)。本文对不同将音素信息融入语音增强模型的方法进行了系统性比较。通过一系列受控实验,我们考察了不同音素内容模型以及各种特征注入技术对增强性能的影响,同时考虑了因果与非因果模型。具体而言,我们评估了三种注入音素信息的设置,即:i) 特征条件化;ii) 感知监督;iii) 正则化。音素特征通过使用有监督预训练自动语音识别(ASR)模型的中间层或预训练自监督学习(SSL)模型获得。我们进一步考察了选择不同嵌入层对性能的影响,同时考虑了手动与学习到的配置。结果表明,在大多数情况下,使用 SSL 模型作为音素特征优于 ASR 模型。有趣的是,在所评估的配置中,条件化设置表现最佳。
引用
@article{arxiv.2206.11000,
title = {A Systematic Comparison of Phonetic Aware Techniques for Speech Enhancement},
author = {Or Tal and Moshe Mandel and Felix Kreuk and Yossi Adi},
journal= {arXiv preprint arXiv:2206.11000},
year = {2022}
}
备注
Published @ Interspeech 2022