中文

通过参数重要性分析理解语音大语言模型中的文本能力退化

计算与语言 2025-09-30 v1 人工智能

摘要

语音与大语言模型(LLM)的集成大幅扩展了其能力,但往往以削弱核心文本能力为代价。这种退化限制了语音启用 LLM 充分利用其预训练文本知识的能力。在本工作中,我们通过聚焦研究广泛使用的编码器-适配器范式来分析该问题的底层机制。我们提出了一种基于参数重要性估计的分析框架,揭示语音微调引入了文本重要性分布偏移:关键于文本推理的逐层参数分配被打乱。基于这一洞察,我们研究了两种缓解策略:逐层学习率调度和低秩适配(LoRA),两者均旨在保持原始参数分布。实验结果表明,两种方法比全量微调更好地保持了文本能力,同时也改善了下游口语问答性能。此外,我们的分析为所提缓解策略的有效性提供了原则性解释,将其优势与 LLMs 中文本知识的结构特性联系起来。

关键词

引用

@article{arxiv.2509.23755,
  title  = {Understanding Textual Capability Degradation in Speech LLMs via Parameter Importance Analysis},
  author = {Chao Wang and Rui-Chen Zheng and Yang Ai and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:2509.23755},
  year   = {2025}
}