中文

基于域适应与自编码器的无监督语音增强

声音 2021-12-10 v1 音频与语音处理

摘要

作为迁移学习的一类,域适应在将某一任务中训练的模型推广并应用于其他相似任务或场景方面发挥着重要作用。在语音增强中,训练良好的声学模型可被利用以获取其他语言、说话人和环境下的语音信号。近期域适应研究借助各种神经网络和高层抽象特征得到了更有效的开展。然而,相关研究更倾向于将训练良好的模型从丰富且更多样的域迁移到有限且相似的域。因此,本研究针对相反情形——迁移到更大更丰富的域——提出无监督语音增强中的域适应方法。一方面,利用重要性加权(IW)方法结合方差约束自编码器,减小源域与目标域之间共享权重的偏移。另一方面,为以最坏情况权重训练分类器并最小化风险,提出极小极大方法。所提出的 IW 和极小极大方法均从 VOICE BANK 和 IEEE 数据集评估至 TIMIT 数据集。实验结果表明,所提方法优于当前最先进的方法。

关键词

引用

@article{arxiv.2112.05036,
  title  = {Domain Adaptation and Autoencoder Based Unsupervised Speech Enhancement},
  author = {Yi Li and Yang Sun and Kirill Horoshenkov and Syed Mohsen Naqvi},
  journal= {arXiv preprint arXiv:2112.05036},
  year   = {2021}
}