中文

LASPA:基于前缀微调交叉注意力的语言无关说话人解耦

声音 2025-06-04 v1 人工智能 机器学习 多媒体

摘要

由于语言信息与说话人嵌入的纠缠,说话人识别模型在多语言环境中面临挑战。嗓音特征(如口音、发声器官解剖结构和语言的语音结构)之间的重叠,使得分离语言信息和说话人信息变得复杂。解耦这些组件可以显著提高说话人识别的准确率。为此,我们提出了一种新颖的解耦学习策略,该策略通过前缀微调交叉注意力整合联合学习。当说话人在语言之间切换时,这种方法尤为有效。实验结果表明,该模型在单语言和多语言环境中均具有泛化能力,包括未见过的语言。值得注意的是,所提出的模型改善了多个数据集上的等错误率,突显了其将语言信息从说话人嵌入中分离出来并增强多样化语言条件下识别的能力。

关键词

引用

@article{arxiv.2506.02083,
  title  = {LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention},
  author = {Aditya Srinivas Menon and Raj Prakash Gohil and Kumud Tripathi and Pankaj Wasnik},
  journal= {arXiv preprint arXiv:2506.02083},
  year   = {2025}
}

备注

Accepted at Interspeech 2025, Netherlands