中文

Speaker-IPL:基于 i-Vector 伪标签的说话人特征无监督学习

音频与语音处理 2025-01-22 v2 声音

摘要

迭代自训练,或迭代伪标签化——使用当前迭代改进的模型为下一次迭代提供伪标签——已被证明是提升说话人表示质量的强大方法。近期 IPL 在无监督说话人识别中的应用,始于从非常复杂的自监督方法(如 DINO)中提取的表示。然而,训练此类强大的自监督模型并非易事(它们需要超参数调优,且可能无法泛化到域外数据),而且可能根本不需要。为此,我们表明简单、经过充分研究且成熟的 i-vector 生成模型足以引导 IPL 过程,用于说话人表示的无监督学习。我们还系统研究了其他组件对 IPL 过程的影响,包括初始模型、编码器、数据增强、聚类数量和聚类算法。值得注意的是,我们发现即使使用像 i-vector 这样简单且明显较弱的初始模型,IPL 仍然能够实现与最先进方法相媲美的说话人验证性能。

关键词

引用

@article{arxiv.2409.10791,
  title  = {Speaker-IPL: Unsupervised Learning of Speaker Characteristics with i-Vector based Pseudo-Labels},
  author = {Zakaria Aldeneh and Takuya Higuchi and Jee-weon Jung and Li-Wei Chen and Stephen Shum and Ahmed Hussen Abdelaziz and Shinji Watanabe and Tatiana Likhomanenko and Barry-John Theobald},
  journal= {arXiv preprint arXiv:2409.10791},
  year   = {2025}
}

备注

ICASSP 2025