中文

面向稳健说话人嵌入的 Xi+:不确定性监督

声音 2026-01-23 v4 音频与语音处理

摘要

存在多种因素会影响说话人识别系统的性能,包括情绪、语言以及其他说话人相关或情境相关的变异。由于单个语音帧在对整个语音的表示贡献不相等,估计每帧的重要性或可靠性至关重要。xi-vector模型通过基于不确定性估计为帧分配不同权重来解决此问题。然而,其不确定性估计模型仅通过分类损失隐式训练,未考虑帧之间的时序关系,可能导致监督不佳。在本文中,我们提出了改进架构xi+。与xi-vector相比,xi+包含时序注意力模块,以上下文感知方式捕获帧级不确定性。此外,我们引入新型损失函数——随机方差损失(Stochastic Variance Loss),显式监督不确定性学习。结果表明,在VoxCeleb1-O数据集上实现约10%的性能提升,在NIST SRE 2024评估集上实现约11%的提升。

关键词

引用

@article{arxiv.2509.05993,
  title  = {Xi+: Uncertainty Supervision for Robust Speaker Embedding},
  author = {Junjie Li and Kong Aik Lee and Duc-Tuan Truong and Tianchi Liu and Man-Wai Mak},
  journal= {arXiv preprint arXiv:2509.05993},
  year   = {2026}
}