使用自监督语音特征能否移除说话人识别的下游模型?
声音
2024-06-14 v2 音频与语音处理
摘要
自监督特征通常用于替代说话人验证模型中的滤波器组特征。然而,这些模型最初被设计为以滤波器组特征作为输入,因此,在自监督特征之上训练它们假设两种特征类型在任务中需要相同的学习量。在这项工作中,我们观察到预训练的自监督语音特征固有地包含了下游说话人验证任务所需的信息,因此,我们可以在不牺牲性能的情况下简化下游模型。为此,我们重新审视了使用自监督特征的说话人验证下游模型的设计。我们表明可以将模型简化为使用减少 97.51% 的参数,同时在 SUPERB 上实现 29.93% 的平均性能提升。因此,我们表明与基线相比,简化后的下游模型具有更高的数据效率——仅使用 60% 的训练数据即可获得更好的性能。
引用
@article{arxiv.2402.00340,
title = {Can you Remove the Downstream Model for Speaker Recognition with Self-Supervised Speech Features?},
author = {Zakaria Aldeneh and Takuya Higuchi and Jee-weon Jung and Skyler Seto and Tatiana Likhomanenko and Stephen Shum and Ahmed Hussen Abdelaziz and Shinji Watanabe and Barry-John Theobald},
journal= {arXiv preprint arXiv:2402.00340},
year = {2024}
}