中文

基于预测代码的因果自监督预训练前端用于语音分离

声音 2025-04-04 v1 机器学习 音频与语音处理

摘要

语音分离 (SS) 旨在将多说话人语音混合信号分离为单个说话人语音流。虽然 SS 可通常通过离线方法实现,但此处理范式不适用于实时流式应用。依赖过去和当下信息的因果分离模型为实时流式提供了有前景的解决方案。然而,这些模型通常因缺乏未来上下文而出现显著性能下降。本文引入了一个新型前端,旨在通过预测模式在因果模型中隐式地融合未来信息,从而缓解训练与运行时推断之间的不匹配。预训练前端采用带有因果卷积编码器的变换器解码器作为骨干网络,并通过两种创新的预文本任务进行自监督预训练:自回归混合预测和情境知识蒸馏。这些任务使模型能够从混合信号中以自监督方式捕获预测模式。预训练前端随后作为特征提取器生成高质量的预测模式。在合成数据和真实世界数据集上的全面评估验证了所提出预训练前端的有效性。

关键词

引用

@article{arxiv.2504.02302,
  title  = {Causal Self-supervised Pretrained Frontend with Predictive Code for Speech Separation},
  author = {Wupeng Wang and Zexu Pan and Xinke Li and Shuai Wang and Haizhou Li},
  journal= {arXiv preprint arXiv:2504.02302},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2411.03085