中文

面向 TidyVoice 2026 挑战的语言无关多语言说话人验证

音频与语音处理 2026-03-10 v1

摘要

多语言说话人验证(SV)因说话人嵌入中语言依赖信息有限,以及跨语言数据不足而面临挑战。本文为 TidyVoice 2026 挑战提出了一种语言无关的多语言 SV 系统。我们采用 multilingual self-supervised w2v-BERT 2.0 模型作为主干,增强了 Layer Adapter 和多尺度特征聚合,以更好地利用多层表示。应用带有梯度反转层的语言对抗训练策略,以促进语言无关的说话人嵌入。此外,我们使用多语言零样本文本到语音系统合成多语言语音,提高语言多样性。实验结果表明,在大规模预训练模型上进行微调可获得具竞争力的性能,而语言对抗训练进一步提升了鲁棒性。此外,在训练数据有限的情况下,合成语音数据增强提供了额外的提升。源代码已公开于 https://github.com/ZXHY-82/LI-MSV-TidyVoice2026。

关键词

引用

@article{arxiv.2603.08092,
  title  = {Language-Invariant Multilingual Speaker Verification for the TidyVoice 2026 Challenge},
  author = {Ze Li and Xiaoxiao Miao and Juan Liu and Ming Li},
  journal= {arXiv preprint arXiv:2603.08092},
  year   = {2026}
}

备注

submitted to Interspeech 2026