中文

基于掩码语音增强中的任务感知扭曲因子

声音 2021-08-30 v1 人工智能 音频与语音处理

摘要

本文提出在基于掩码的语音增强(SE)中使用两个任务感知扭曲因子。一个在训练阶段控制语音保持与噪声去除之间的平衡,另一个在测试阶段控制应用于特定下游任务的SE强度。我们的意图是缓解以下的问题:为改善语音质量而训练的SE系统往往无法改善其他下游任务(如自动说话人验证(ASV)和自动语音识别(ASR)),因为它们不具有相同的目标。所提出的双扭曲因子方法易于应用于任何基于掩码的SE方法,并且它允许单个SE系统在不依赖任务训练的情况下处理多个任务。我们所提方法的有效性已在用于ASV评估的SITW数据集和用于ASR及0-20dB语音质量评估的LibriSpeech数据集上得到证实。我们表明,对于单个SE而言,要实现针对这三个任务的最优性能,需要不同的扭曲值。使用任务相关扭曲因子,在0dB语音上,语音质量通过84.7%的PESQ提升得以改善,ASV实现了22.4%的EER降低,ASR实现了52.2%的WER降低。任务相关扭曲因子的有效性也在VoxCeleb-1测试集(用于ASV)和LibriSpeech dev-clean集(用于ASV和质量评估)上进行了交叉验证。所提方法高度有效且易于实际部署。

关键词

引用

@article{arxiv.2108.12128,
  title  = {Task-aware Warping Factors in Mask-based Speech Enhancement},
  author = {Qiongqiong Wang and Kong Aik Lee and Takafumi Koshinaka and Koji Okabe and Hitoshi Yamamoto},
  journal= {arXiv preprint arXiv:2108.12128},
  year   = {2021}
}

备注

EUSIPCO 2021 (the 29th European Signal Processing Conference)