EFFUSE:低资源与多语言场景下用于端到端 ASR 的高效自监督特征融合
声音
2024-06-07 v2 音频与语音处理
摘要
自监督学习(SSL)模型已在各类语音任务中展现出卓越性能,尤其在低资源与多语言领域。近期工作表明,融合多种 SSL 模型可比使用单一 SSL 模型获得更优性能。然而,模型融合会增加整体参数量,导致更高的计算成本。我们提出 EFFUSE,一种新颖的方法,利用单个 SSL 模型通过预测来模仿多个 SSL 模型的特征,从而构建一个具有竞争力性能的轻量框架。我们的实验表明,EFFUSE 在多语言语音识别任务中优于单独的 SSL 模型。我们性能最佳的模型在多语言语音通用性能基准(ML-SUPERB)中,相较 SSL 基线实现了平均 SUPERB 分数提升 63.5(6.3%),同时相较融合模型平均减少参数量 317M(49%)。
引用
@article{arxiv.2310.03938,
title = {EFFUSE: Efficient Self-Supervised Feature Fusion for E2E ASR in Low Resource and Multilingual Scenarios},
author = {Tejes Srivastava and Jiatong Shi and William Chen and Shinji Watanabe},
journal= {arXiv preprint arXiv:2310.03938},
year = {2024}
}
备注
5 pages, 2 figures, 3 tables