神经评分:面向复杂场景的说话人识别新型端到端方法
声音
2025-07-04 v3 音频与语音处理
摘要
现代说话人验证系统主要依赖于说话人嵌入向量,随后基于 enrollment 与 test 说话片段嵌入向量之间的余弦相似度进行验证。虽然有效,但这些方法在面对多说话人语音时难以处理嵌入向量的不可辨性。本文提出了神经评分(Neural Scoring, NS),一种 refreshed 的 end-to-end 框架,直接估计验证后验概率,而无需依赖 test 侧嵌入向量,使其在复杂场景(如多说话人)下更具鲁棒性。为使此类 end-to-end 模型的训练更高效,我们引入了大规模 trial e2e 训练(LtE2E)策略,即每个 test 说话片段与一组已注册说话人配对,从而使每个 batch 能处理大规模验证 trial。在 VoxCeleb 数据集上的实验表明,NS 在各种条件下均优于基线和竞争方法,整体 EER 降低了70.36%。
引用
@article{arxiv.2410.16428,
title = {Neural Scoring: A Refreshed End-to-End Approach for Speaker Recognition in Complex Conditions},
author = {Wan Lin and Junhui Chen and Tianhao Wang and Zhenyu Zhou and Lantian Li and Dong Wang},
journal= {arXiv preprint arXiv:2410.16428},
year = {2025}
}