中文

CURriculum Ranking Loss for Large-Scale Speaker Verification: 什么以及何时学习

声音 2026-03-26 v1 计算与语言

摘要

大规模说话人验证仍是一个开放性挑战,因为固定边际损失会对所有样本相等对待,无论其质量如何。我们假设,误标记或降级样本会引入噪声梯度,干扰说话人流形的紧凑性。我们提出了Curry(CURriculum Ranking),一种自适应损失函数,通过Sub-center ArcFace估计样本难度:来自dominant sub-center余弦相似度的置信度得分将样本排序为易、中、难三个层级,无需额外标注。可学习的权重引导模型从稳定的身份基础到流形细化再到边界锐化。到我们知识的前沿,这是目前规模最大的说话人验证系统。评估VoxCeleb1-O和SITW时,Curry相对于Sub-center ArcFace基线将EER降低86.8%和60.0%,确立了一种针对不完美大规模数据的稳健说话人验证的新范式。

引用

@article{arxiv.2603.24432,
  title  = {What and When to Learn: CURriculum Ranking Loss for Large-Scale Speaker Verification},
  author = {Massa Baali and Sarthak Bisht and Rita Singh and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2603.24432},
  year   = {2026}
}