LoRA适配Whisper语音情感识别的机制解释
声音
2026-01-23 v3 机器学习
音频与语音处理
摘要
大型预训练语音模型如Whisper提供强大的泛化能力,但在资源高效适应方面面临重大挑战。低秩适应(LoRA)已成为参数高效微调方法,但其在语音任务中的底层机制仍鲜有了解。本文对LoRA在Whisper编码器用于语音情感识别(SER)的机制进行首次系统性解释研究。我们采用一套分析工具,包括图层贡献探针、logit-lens检查以及奇异值分解(SVD)和中心核对齐(CKA)的表征相似性,揭示了两个关键机制:一种延迟专化过程在保护早期层的通用特征的同时,在整合任务特定信息方面的动态;以及LoRA矩阵之间正向对齐、反向梯度分离的动态。我们的发现阐明了LoRA如何重塑编码器层次结构,为设计高效且可解释的大型语音模型适应策略提供了实证见解和深层机制理解。我们的代码可在https://github.com/harryporry77/Behind-the-Scenes获取。
引用
@article{arxiv.2509.08454,
title = {Behind the Scenes: Mechanistic Interpretability of LoRA-adapted Whisper for Speech Emotion Recognition},
author = {Yujian Ma and Xikun Lu and Jinqiu Sang and Xianquan Jiang and Ruizhe Li},
journal= {arXiv preprint arXiv:2509.08454},
year = {2026}
}
备注
Accepted at ICASSP 2026