Speaker-IPL:基于 i-Vector 伪标签的说话人特征无监督学习
音频与语音处理
2025-01-22 v2 声音
摘要
迭代自训练,或迭代伪标签化——使用当前迭代改进的模型为下一次迭代提供伪标签——已被证明是提升说话人表示质量的强大方法。近期 IPL 在无监督说话人识别中的应用,始于从非常复杂的自监督方法(如 DINO)中提取的表示。然而,训练此类强大的自监督模型并非易事(它们需要超参数调优,且可能无法泛化到域外数据),而且可能根本不需要。为此,我们表明简单、经过充分研究且成熟的 i-vector 生成模型足以引导 IPL 过程,用于说话人表示的无监督学习。我们还系统研究了其他组件对 IPL 过程的影响,包括初始模型、编码器、数据增强、聚类数量和聚类算法。值得注意的是,我们发现即使使用像 i-vector 这样简单且明显较弱的初始模型,IPL 仍然能够实现与最先进方法相媲美的说话人验证性能。
引用
@article{arxiv.2409.10791,
title = {Speaker-IPL: Unsupervised Learning of Speaker Characteristics with i-Vector based Pseudo-Labels},
author = {Zakaria Aldeneh and Takuya Higuchi and Jee-weon Jung and Li-Wei Chen and Stephen Shum and Ahmed Hussen Abdelaziz and Shinji Watanabe and Tatiana Likhomanenko and Barry-John Theobald},
journal= {arXiv preprint arXiv:2409.10791},
year = {2025}
}
备注
ICASSP 2025