中文

神经评分:面向复杂场景的说话人识别新型端到端方法

声音 2025-07-04 v3 音频与语音处理

摘要

现代说话人验证系统主要依赖于说话人嵌入向量,随后基于 enrollment 与 test 说话片段嵌入向量之间的余弦相似度进行验证。虽然有效,但这些方法在面对多说话人语音时难以处理嵌入向量的不可辨性。本文提出了神经评分(Neural Scoring, NS),一种 refreshed 的 end-to-end 框架,直接估计验证后验概率,而无需依赖 test 侧嵌入向量,使其在复杂场景(如多说话人)下更具鲁棒性。为使此类 end-to-end 模型的训练更高效,我们引入了大规模 trial e2e 训练(LtE2E)策略,即每个 test 说话片段与一组已注册说话人配对,从而使每个 batch 能处理大规模验证 trial。在 VoxCeleb 数据集上的实验表明,NS 在各种条件下均优于基线和竞争方法,整体 EER 降低了70.36%。

关键词

引用

@article{arxiv.2410.16428,
  title  = {Neural Scoring: A Refreshed End-to-End Approach for Speaker Recognition in Complex Conditions},
  author = {Wan Lin and Junhui Chen and Tianhao Wang and Zhenyu Zhou and Lantian Li and Dong Wang},
  journal= {arXiv preprint arXiv:2410.16428},
  year   = {2025}
}