SV-Mixer:用轻量级MLP替代Transformer编码器实现说话人验证中的自监督模型压缩
音频与语音处理
2025-09-18 v1
摘要
自监督学习(SSL)已将说话人验证的准确率提升至接近最先进水平,但大多数SSL编码器使用的Transformer主干网络阻碍了设备端和实时部署。先前的压缩工作裁剪了层深度或宽度,但仍继承了自注意力的二次方计算成本。我们提出SV-Mixer,这是首个用于SSL蒸馏的完全基于MLP的学生编码器。SV-Mixer用三个轻量级模块替代Transformer:用于多分辨率时间特征的多尺度混合模块、用于帧到话语上下文的局部-全局混合模块,以及用于频谱子空间的组通道混合模块。从WavLM蒸馏得到的SV-Mixer在参数和GMACs减少超过一半的情况下,性能比Transformer学生模型高出14.6%,并且在75%压缩率下,其性能与教师模型非常接近。我们的结果表明,无注意力的SSL学生模型能够以对硬件友好的规模实现教师级别的准确率,为稳健的设备端说话人验证开辟了道路。
引用
@article{arxiv.2509.14136,
title = {SV-Mixer: Replacing the Transformer Encoder with Lightweight MLPs for Self-Supervised Model Compression in Speaker Verification},
author = {Jungwoo Heo and Hyun-seo Shin and Chan-yeong Lim and Kyo-won Koo and Seung-bin Kim and Jisoo Son and Ha-Jin Yu},
journal= {arXiv preprint arXiv:2509.14136},
year = {2025}
}
备注
8 pages, 5 figures, accepted at IEEE ASRU 2025