Eta-WavLM:使用简单线性方程在自监督语音表征中高效移除说话人身份
声音
2025-05-27 v1 人工智能
音频与语音处理
摘要
自监督学习(SSL)通过从无标注数据中学习有意义的表征,降低了语音技术对昂贵标注的依赖。由于大多数基于 SSL 的下游任务优先考虑语音中的内容信息,理想的表征应该在 SSL 表征中将内容与说话人特征等不需要的变化因素解耦。然而,移除说话人信息通常会降低其他语音成分,且现有方法要么无法完全解耦说话人身份,要么需要资源密集型模型。在本文中,我们提出了一种新颖的解耦方法,将 SSL 表征线性分解为说话人特定和说话人无关的成分,从而有效地生成说话人解耦的表征。综合实验表明,我们的方法实现了说话人独立性,因此,当应用于语音转换等内容驱动的任务时,我们的表征比最先进的方法取得了显著的改进。
引用
@article{arxiv.2505.19273,
title = {Eta-WavLM: Efficient Speaker Identity Removal in Self-Supervised Speech Representations Using a Simple Linear Equation},
author = {Giuseppe Ruggiero and Matteo Testa and Jurgen Van de Walle and Luigi Di Caro},
journal= {arXiv preprint arXiv:2505.19273},
year = {2025}
}
备注
Full paper accepted at ACL 2025