中文

损失亦可成祝福:将自监督语音表征路由至高效多语言与多任务语音处理

机器学习 2025-01-07 v2 声音 音频与语音处理

摘要

用于丰富语音表征的自监督学习(SSL)在低资源自动语音识别(ASR)及其他语音处理任务中已取得经验性成功,可缓解对大量转写语音的需求,从而推动了设备上ASR及其他语音处理日益增长的需求。然而,先进的语音SSL模型变得日益庞大,这与有限的设备资源相矛盾。在需要同时识别多种语言或执行多个语音处理任务的多语言/多任务场景中,这一差距可能更为严重。此外,强过参数化的语音SSL模型在低资源语音语料上微调时往往出现过拟合。本工作旨在通过我们提出的S3^3-Router框架增强语音SSL模型的实际使用,在提升效率与缓解过拟合方面实现双赢;该框架首次发现,仅通过微调语音SSL模型的连接并简单丢弃不超过10%的模型权重,即可在下游语音处理任务上取得优于标准权重微调的精度。更重要的是,S3^3-Router可作为一种一体化技术来实现(1)一种新的微调方案,(2)一种高效的多语言/多任务解决方案,(3)一种最先进的ASR剪枝技术,以及(4)一种定量分析了所学语音表征的新工具。我们相信S3^3-Router为语音SSL模型的实际部署提供了新视角。我们的代码见:https://github.com/GATECH-EIC/S3-Router。

关键词

引用

@article{arxiv.2211.01522,
  title  = {Losses Can Be Blessings: Routing Self-Supervised Speech Representations Towards Efficient Multilingual and Multitask Speech Processing},
  author = {Yonggan Fu and Yang Zhang and Kaizhi Qian and Zhifan Ye and Zhongzhi Yu and Cheng-I Lai and Yingyan Celine Lin},
  journal= {arXiv preprint arXiv:2211.01522},
  year   = {2025}
}

备注

Accepted at NeurIPS 2022