SSPS:用于鲁棒自监督说话人确认的自监督正采样
音频与语音处理
2025-08-20 v2 人工智能
机器学习
声音
摘要
自监督学习(SSL)在说话人确认(SV)中取得了显著进展。标准框架使用同话语正采样和数据增强来生成同一说话人的锚点-正样本对。这是一个主要局限,因为该策略主要编码了锚点和正样本共享的录音条件中的信道信息。我们提出了一种新的正采样技术来解决这一瓶颈:自监督正采样(SSPS)。对于给定的锚点,SSPS 旨在利用聚类分配和正样本嵌入的记忆队列,在潜在空间中寻找一个合适的正样本,即具有相同说话人身份但录音条件不同的样本。SSPS 提高了 SimCLR 和 DINO 的 SV 性能,分别达到了 2.57% 和 2.53% 的 EER,在 VoxCeleb1-O 上优于 SOTA SSL 方法。特别是,SimCLR-SSPS 通过降低说话人内部方差实现了 58% 的 EER 降低,提供了与 DINO-SSPS 相当的性能。
引用
@article{arxiv.2505.14561,
title = {SSPS: Self-Supervised Positive Sampling for Robust Self-Supervised Speaker Verification},
author = {Theo Lepage and Reda Dehak},
journal= {arXiv preprint arXiv:2505.14561},
year = {2025}
}
备注
accepted at Interspeech 2025