对比自监督框架中添加边际的作用于学习判别性说话人表征
音频与语音处理
2025-06-25 v1 机器学习
声音
摘要
自监督学习 (SSL) 框架已成为通过从大规模无标签数据集中受益于学习稳健类表征的标准方法。对于说话人验证 (SV),大多数 SSL 系统依赖于对比基于损失函数。我们探讨了通过重新审视 NT-Xent 对比损失来改进这些技术性能的不同方法。我们的主要贡献是定义 NT-Xent-AM 损失,并研究 SimCLR 和 MoCo SSL 方法中添加边际 (AM) 的重要性,以进一步分离正负配对。尽管存在类碰撞,我们显示 AM 可增强相同说话人嵌入的紧凑性,并减少 SV 上误报和漏报的数量。此外,我们演示了对称对比损失的有效性,该损失为 SSL 任务提供更多监督。实现这些两项修改后的 SimCLR 在 VoxCeleb1-O 上达到 7.85% 的 EER,超越了其他等效方法。
引用
@article{arxiv.2404.14913,
title = {Additive Margin in Contrastive Self-Supervised Frameworks to Learn Discriminative Speaker Representations},
author = {Theo Lepage and Reda Dehak},
journal= {arXiv preprint arXiv:2404.14913},
year = {2025}
}
备注
accepted at Odyssey 2024: The Speaker and Language Recognition Workshop. arXiv admin note: text overlap with arXiv:2306.03664