自监督语音表示的自适应联邦微调
音频与语音处理
2026-03-26 v2
摘要
将联邦学习(FL)与自监督学习(SSL)集成可实现语音任务的隐私保护微调。然而,联邦环境存在显著异构性:客户端在计算容量上差异大,统一微调下会产生阻塞效应;而 diverse downstream任务需要不同的表示深度,导致全模型更新效率低下。为此,我们提出一种带有早期退出的自适应联邦微调框架。在SSL backbone的中间层插入轻量级预测头,允许客户端根据本地约束和任务要求终止计算。我们进一步引入基于层的、深度感知的部分聚合策略,以更好地利用来自不同网络深度的表示。实验表明,该框架降低了边缘端开销,支持异构硬件,同时在资源受限的联邦环境中保持竞争性能。
引用
@article{arxiv.2603.21888,
title = {Adaptive Federated Fine-Tuning of Self-Supervised Speech Representations},
author = {Xin Guo and Chunrui Zhao and Hong Jia and Ting Dang and Gongping Huang and Xianrui Zheng and Yan Gao},
journal= {arXiv preprint arXiv:2603.21888},
year = {2026}
}
备注
Submitted to Interspeech 2026