中文

利用预训练自监督学习模型进行目标语音提取

音频与语音处理 2024-02-21 v1 声音

摘要

预训练自监督学习(SSL)模型在各种语音任务中取得了显著成功。然而,它们在目标语音提取(TSE)中的潜力尚未得到充分利用。TSE 旨在根据注册语音引导,从混合信号中提取目标说话人的语音。我们在 TSE 框架中利用预训练 SSL 模型实现两个目的:处理输入混合信号以及从注册语音中推导说话人嵌入。本文重点关注如何有效地将 SSL 模型用于 TSE。我们首先遵循 SUPERB 原则引入了一项新的 TSE 下游任务。这项简单的实验展示了 SSL 模型在 TSE 方面的潜力,但提取性能仍远落后于最先进水平(SOTA)。随后,我们通过整合两个基于 SSL 的模块扩展了一个强大的 TSE 架构:自适应输入增强器(AIE)和说话人编码器。具体而言,提出的 AIE 利用 CNN 编码器的中间表示,通过渐进式上采样调整 CNN 编码器和 Transformer 块的时间分辨率,从而捕捉细粒度和分层特征。我们的方法优于当前的 TSE 系统,在 LibriMix 数据集上实现了 14.0 dB 的 SI-SDR 提升。此外,通过对包括 SSL 模型参数在内的整个模型进行微调,我们可以将性能进一步提升 0.7 dB。

关键词

引用

@article{arxiv.2402.13199,
  title  = {Target Speech Extraction with Pre-trained Self-supervised Learning Models},
  author = {Junyi Peng and Marc Delcroix and Tsubasa Ochiai and Oldrich Plchot and Shoko Araki and Jan Cernocky},
  journal= {arXiv preprint arXiv:2402.13199},
  year   = {2024}
}

备注

Accepted to ICASSP 2024