中文

SSPS:用于鲁棒自监督说话人确认的自监督正采样

音频与语音处理 2025-08-20 v2 人工智能 机器学习 声音

摘要

自监督学习(SSL)在说话人确认(SV)中取得了显著进展。标准框架使用同话语正采样和数据增强来生成同一说话人的锚点-正样本对。这是一个主要局限,因为该策略主要编码了锚点和正样本共享的录音条件中的信道信息。我们提出了一种新的正采样技术来解决这一瓶颈:自监督正采样(SSPS)。对于给定的锚点,SSPS 旨在利用聚类分配和正样本嵌入的记忆队列,在潜在空间中寻找一个合适的正样本,即具有相同说话人身份但录音条件不同的样本。SSPS 提高了 SimCLR 和 DINO 的 SV 性能,分别达到了 2.57% 和 2.53% 的 EER,在 VoxCeleb1-O 上优于 SOTA SSL 方法。特别是,SimCLR-SSPS 通过降低说话人内部方差实现了 58% 的 EER 降低,提供了与 DINO-SSPS 相当的性能。

关键词

引用

@article{arxiv.2505.14561,
  title  = {SSPS: Self-Supervised Positive Sampling for Robust Self-Supervised Speaker Verification},
  author = {Theo Lepage and Reda Dehak},
  journal= {arXiv preprint arXiv:2505.14561},
  year   = {2025}
}

备注

accepted at Interspeech 2025