中文

TS-SUPERB:面向目标说话人语音处理基准

计算与语言 2025-05-13 v1 声音 音频与语音处理

摘要

自监督学习(SSL)模型显著推进了语音处理任务,已提出多个基准以验证其有效性。然而,先前的基准主要关注单说话人场景,对于噪声、多说话人条件下的目标说话人任务探索较少——这是一种更具挑战性且更实际的情况。本文引入目标说话人语音处理通用性能基准(TS-SUPERB),包括四个广为认可的目标说话人处理任务,这些任务需要识别目标说话人并从语音混合信号中提取信息。在我们的基准中,使用来自 enrollment 语音的说话人嵌入作为条件来指导下游模型。基准结果揭示了在目标说话人场景下评估 SSL 模型的重要性,表明其性能不能轻易从相关的单说话人任务中推断。此外,通过使用统一的基于 SSL 的目标语音编码器(由说话人编码器和提取模块组成),我们还探索了跨 TS 任务的联合优化,以利用互信息并展示其有效性。

关键词

引用

@article{arxiv.2505.06660,
  title  = {TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models},
  author = {Junyi Peng and Takanori Ashihara and Marc Delcroix and Tsubasa Ochiai and Oldrich Plchot and Shoko Araki and Jan Černocký},
  journal= {arXiv preprint arXiv:2505.06660},
  year   = {2025}
}

备注

Accepted at ICASSP 2025