中文

利用目标语音提取探测自监督学习模型

音频与语音处理 2024-02-21 v1 声音

摘要

大规模预训练自监督学习(SSL)模型在语音相关任务中显示出显著进展。然而,这些模型在复杂的多说话人场景(例如从混合信号中提取目标说话人)中的应用尚未得到充分评估。在本文中,我们引入目标语音提取(TSE)作为一项新的下游任务,以评估预训练 SSL 模型的特征提取能力。TSE 独特地需要说话人识别和语音分离,这使其区别于语音处理通用性能基准(SUPERB)评估中的其他任务。具体而言,我们提出了一种 TSE 下游模型,该模型由两个基于同一冻结 SSL 模型的轻量级任务导向模块组成。一个模块作为说话人编码器,从注册语音中获取目标说话人信息;另一个模块则估计目标说话人的掩码,以从混合信号中提取其语音。在 Libri2mix 数据集上的实验结果揭示了 TSE 下游任务在探测 SSL 模型方面的相关性,因为其性能不能简单地从说话人验证和分离等其他相关任务中推导出来。

关键词

引用

@article{arxiv.2402.13200,
  title  = {Probing Self-supervised Learning Models with Target Speech Extraction},
  author = {Junyi Peng and Marc Delcroix and Tsubasa Ochiai and Oldrich Plchot and Takanori Ashihara and Shoko Araki and Jan Cernocky},
  journal= {arXiv preprint arXiv:2402.13200},
  year   = {2024}
}

备注

Accepted to ICASSP 2024, Self-supervision in Audio, Speech, and Beyond (SASB) workshop