基于特征学习与集成预任务的自监督语音去噪与去混响
声音
2022-06-13 v1 音频与语音处理
摘要
自监督学习(SSL)在单通道语音增强中取得巨大成功,但现有预任务对目标语音估计的准确度(尤其对未见说话人)仍显不足。由于语音信号包含说话人身份、副语言与语音内容等多面信息,语音增强的潜在表示成为一项艰巨任务。本文研究语音增强中常用各特征的有效性,并探索 SSL 情形下的特征组合。此外,我们提出一种集成训练策略:学习干净语音信号的潜在表示,同时利用去混响掩码与估计比率掩码对混合语音去噪与去混响;潜在表示学习与掩码估计在训练阶段被视为两个预任务。另外,为研究预任务间有效性,我们比较不同训练流程以训练模型并进一步优化性能。使用 NOISEX 与 DAPS 语料库评估所提方法的有效性,其亦优于 SOTA 方法。
引用
@article{arxiv.2206.04962,
title = {Feature Learning and Ensemble Pre-Tasks Based Self-Supervised Speech Denoising and Dereverberation},
author = {Yi Li and ShuangLin Li and Yang Sun and Syed Mohsen Naqvi},
journal= {arXiv preprint arXiv:2206.04962},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2112.11142