Selective HuBERT:面向干净与混合语音中目标说话人的自监督预训练
音频与语音处理
2023-11-09 v1
摘要
自监督预训练语音模型已被证明对各类下游语音处理任务有效。由于它们主要被预训练为将输入语音映射至伪标签,所得表征仅对所用预训练数据类型(干净或混合语音)有效。受选择性听觉注意力启发,我们提出一种名为 Selective-HuBERT(简称 SHuBERT)的新型预训练方案,其学习从干净或混合语音中选择性提取目标语音表征。具体而言,SHuBERT 被训练为在给定目标说话人注册语音的条件下预测该目标说话人的伪标签。由此,SHuBERT 有望在复杂声学环境中选择性关注目标说话人,从而惠及各类下游任务。我们进一步引入双路径训练策略,并利用两分支间的互相关约束促使模型生成噪声不变表征。在 SUPERB 基准与 LibriMix 数据集上的实验证明了 SHuBERT 的通用性与噪声鲁棒性。此外,我们发现所提高质量表征可轻松与传统监督学习方法结合,即便在极低资源标注数据下也能取得显著性能。
引用
@article{arxiv.2311.04526,
title = {Selective HuBERT: Self-Supervised Pre-Training for Target Speaker in Clean and Mixture Speech},
author = {Jingru Lin and Meng Ge and Wupeng Wang and Haizhou Li and Mengling Feng},
journal= {arXiv preprint arXiv:2311.04526},
year = {2023}
}