UniPET-SPK:用于鲁棒说话人验证的预训练语音模型参数高效微调的统一框架
音频与语音处理
2025-01-29 v1 机器学习
声音
摘要
凭借出色的泛化能力,自监督学习(SSL)语音模型在预训练与微调范式下的各种下游任务中展现了令人印象深刻的性能。然而,随着预训练模型规模的不断增长,由于不断膨胀的计算和存储需求以及过拟合的风险,微调在实际中变得不可行。本研究探索了参数高效微调(PET)方法,以将大规模预训练的 SSL 语音模型适配至说话人验证任务。相应地,我们提出了三种 PET 方法: 适配器微调方法, 提示微调方法, 通过动态可学习门控机制有效结合适配器微调与提示微调的统一框架。首先,我们提出了 Inner+Inter Adapter 框架,该框架将两种类型的适配器插入预训练模型中,通过并行适配器设计,允许对中间 Transformer 层内的潜在特征和所有 Transformer 层的输出嵌入进行适配。其次,我们提出了深度说话人提示方法,该方法将可训练的提示 token 拼接到预训练模型的输入空间中以引导适配。最后,我们提出了 UniPET-SPK,这是一个通过动态可训练门控机制将这两种替代性 PET 方法有效结合到单一框架中的统一框架。所提出的 UniPET-SPK 能够学习寻找 PET 方法的最优组合,以匹配不同的数据集和场景。我们在多个数据集上进行了全面的实验,以验证所提出的 PET 方法的有效性。在 VoxCeleb、CN-Celeb 和第一届 48-UTD 法庭数据集上的实验结果表明,所提出的 UniPET-SPK 始终优于这两种 PET 方法、微调以及其他参数高效微调方法,在仅更新 5.4% 参数的情况下实现了卓越的性能。
引用
@article{arxiv.2501.16542,
title = {UniPET-SPK: A Unified Framework for Parameter-Efficient Tuning of Pre-trained Speech Models for Robust Speaker Verification},
author = {Mufan Sang and John H. L. Hansen},
journal= {arXiv preprint arXiv:2501.16542},
year = {2025}
}
备注
Accepted to IEEE/ACM Transactions on Audio, Speech, and Language Processing