中文

基于适配器的多标签预训练用于语音分离与增强

音频与语音处理 2022-11-14 v1

摘要

近年来,自监督学习(SSL)因能从海量无标注数据中提取表征,在各种语音任务中取得巨大成功。然而,相较于语音识别(ASR)等任务,SSL 表征在语音分离(SS)与增强(SE)中的提升明显较小。基于 HuBERT,本文研究改进用于 SS 和 SE 的 SSL 模型。我们首先通过整合分离与去噪项更新 HuBERT 的掩码语音预测(MSP)目标,形成多伪标签预训练方案,其显著提升 HuBERT 在 SS 和 SE 上的性能,但降低其在 ASR 上的性能。为保持其在 ASR 上的性能增益,我们进一步提出基于适配器的 HuBERT Transformer 编码器架构,其中仅每层极少参数针对多伪标签 MSP 进行调整,其余参数保持为默认 HuBERT 冻结。实验结果表明,我们提出的基于适配器的多伪标签 HuBERT 在 SE、SS 和 ASR 任务上取得一致且显著的性能提升,预训练速度更快,仅增加极少参数。

关键词

引用

@article{arxiv.2211.06041,
  title  = {An Adapter based Multi-label Pre-training for Speech Separation and Enhancement},
  author = {Tianrui Wang and Xie Chen and Zhuo Chen and Shu Yu and Weibin Zhu},
  journal= {arXiv preprint arXiv:2211.06041},
  year   = {2022}
}

备注

5 pages