说话人识别的自监督学习:一种研究与综述
音频与语音处理
2026-02-12 v1 机器学习
声音
摘要
在监督设置下训练的深度学习模型已彻底改变音频和语音处理领域。然而,它们的性能不可避免地取决于人工标注数据的数量,这使得它们难以规模化且在未见情况下的泛化能力较差。为此,自监督学习 (SSL) 作为一种有前景的范式,正在利用大量无标签数据来学习相关表征而受到关注。SSL 已被广泛应用于自动语音识别 (ASR),但针对其他下游任务,尤其是说话人识别 (SR),的研究仍处于早期阶段。本文描述了主要的 SSL 实例不变性框架(如 SimCLR、MoCo 和 DINO),最初为计算机视觉开发,并阐述了其对 SR 的适应。随后,还介绍了文献中基于这些框架的各种 SSL 方法。随后,对这些方法进行了广泛的综述:(1) 调查了 SSL 框架的主要超参数的影响;(2) 研究了 SSL 组件的作用(如数据增强、投影器、正样本采样);(3) 使用一致的实验设置对 SSL 框架在 SR 上进行评估,并提供了来自文献的方法的全面比较。具体而言,DINO 在下游任务上实现最佳性能,有效地建模了说话人内部的可变性,尽管其对超参数和训练条件高度敏感;而 SimCLR 和 MoCo 提供了稳健的替代方案,有效地捕获说话人之间的可变性,且不易崩溃。这项工作旨在凸显近期趋势和进展,确定该领域的当前挑战。
引用
@article{arxiv.2602.10829,
title = {Self-Supervised Learning for Speaker Recognition: A study and review},
author = {Theo Lepage and Reda Dehak},
journal= {arXiv preprint arXiv:2602.10829},
year = {2026}
}
备注
accepted for publication in Speech Communication