损失亦可成祝福:将自监督语音表征路由至高效多语言与多任务语音处理
机器学习
2025-01-07 v2 声音
音频与语音处理
摘要
用于丰富语音表征的自监督学习(SSL)在低资源自动语音识别(ASR)及其他语音处理任务中已取得经验性成功,可缓解对大量转写语音的需求,从而推动了设备上ASR及其他语音处理日益增长的需求。然而,先进的语音SSL模型变得日益庞大,这与有限的设备资源相矛盾。在需要同时识别多种语言或执行多个语音处理任务的多语言/多任务场景中,这一差距可能更为严重。此外,强过参数化的语音SSL模型在低资源语音语料上微调时往往出现过拟合。本工作旨在通过我们提出的S-Router框架增强语音SSL模型的实际使用,在提升效率与缓解过拟合方面实现双赢;该框架首次发现,仅通过微调语音SSL模型的连接并简单丢弃不超过10%的模型权重,即可在下游语音处理任务上取得优于标准权重微调的精度。更重要的是,S-Router可作为一种一体化技术来实现(1)一种新的微调方案,(2)一种高效的多语言/多任务解决方案,(3)一种最先进的ASR剪枝技术,以及(4)一种定量分析了所学语音表征的新工具。我们相信S-Router为语音SSL模型的实际部署提供了新视角。我们的代码见:https://github.com/GATECH-EIC/S3-Router。
引用
@article{arxiv.2211.01522,
title = {Losses Can Be Blessings: Routing Self-Supervised Speech Representations Towards Efficient Multilingual and Multitask Speech Processing},
author = {Yonggan Fu and Yang Zhang and Kaizhi Qian and Zhifan Ye and Zhongzhi Yu and Cheng-I Lai and Yingyan Celine Lin},
journal= {arXiv preprint arXiv:2211.01522},
year = {2025}
}
备注
Accepted at NeurIPS 2022