中文

面向通用语音处理的条件感知自监督学习表示 CA-SSLR

音频与语音处理 2024-12-06 v1 计算与语言 机器学习 声音

摘要

我们提出 Condition-Aware Self-Supervised Learning Representation (CA-SSLR),这是一种广泛适用于各种语音处理任务的通用条件化模型。与优化下游模型的标准微调方法不同,CA-SSLR 整合了来自更早层的语言和说话人嵌入,使 SSL 模型能够感知当前语言和说话人上下文。这种方法减少了对输入音频特征的依赖,同时保持了基础 SSLR 的完整性。CA-SSLR 提升了模型的能力,展示了其在未见任务上的通用性,仅需最小的任务特定调优。我们的方法采用线性调制动态调整内部表示,实现细粒度的可适应性,而不会显著改变原始模型的行为。实验表明,CA-SSLR 减少了可训练参数的数量,缓解了过拟合问题,在资源受限和未见任务中表现出色。具体而言,CA-SSLR 在 LID 错误中实现 10% 的相对降幅,在 ML-SUPERB 基准测试上的 ASR CER 提升 37%,在 VoxCeleb-1 上的 SV EER 下降 27%,充分展示了其有效性。

关键词

引用

@article{arxiv.2412.04425,
  title  = {CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing},
  author = {Yen-Ju Lu and Jing Liu and Thomas Thebaud and Laureano Moro-Velazquez and Ariya Rastrow and Najim Dehak and Jesus Villalba},
  journal= {arXiv preprint arXiv:2412.04425},
  year   = {2024}
}

备注

38th Conference on Neural Information Processing Systems (NeurIPS 2024)