基于窗口汇总混合的自监督学习模型低资源语音识别高效微调
音频与语音处理
2026-02-11 v1 机器学习
声音
摘要
自监督学习(SSL)已推动语音处理,但因自注意力机制导致二次时间复杂度。为此,提出了 SummaryMixing(SM)作为一种线性时间的替代方案,该方法通过均值池化总结整个 utterance,但缺乏足够的局部上下文。本文引入了 Windowed SummaryMixing(WSM),通过整合局部邻域汇总与全局汇总,既保持效率,又提高了时序依赖性。此外,我们引入一种选择性微调方法,将 SSL 模型中的自注意力层替换为 WSM 模块,仅在低资源设置下微调这些模块。我们的方法在保持 ASR 性能的同时,将 SSL 模型的峰值 VRAM 降低 40%。WSM 模块具有线性时间复杂度,同时具备增强的上下文感知能力。选择性替换部分注意力层可降低计算量、内存占用和延迟,使其在低资源语音识别场景中具有理想的应用前景。
引用
@article{arxiv.2602.09043,
title = {Windowed SummaryMixing: An Efficient Fine-Tuning of Self-Supervised Learning Models for Low-resource Speech Recognition},
author = {Aditya Srinivas Menon and Kumud Tripathi and Raj Gohil and Pankaj Wasnik},
journal= {arXiv preprint arXiv:2602.09043},
year = {2026}
}
备注
The paper has been accepted at ICASSP 2026, Barcelona, Spain