重构基于 LLM 的语音识别中的熵分配:理解语音编码器与大语言模型之间的动态关系
音频与语音处理
2026-04-10 v1 计算与语言
声音
摘要
将大型语言模型(LLM)集成到自动语音识别(ASR)中已成为主流范式。尽管近期的 LLM-based ASR 模型在公共基准测试上显示出良好的性能,但在保持识别质量与延迟、开销之间的平衡方面仍富有挑战性,幻觉现象进一步限制了实际部署。本文从熵分配视角重新审视 LLM-based ASR,引入三项指标来刻画训练范式如何在语音编码器与 LLM 之间分配熵减小时。为解决现有方法中熵分配效率不足的问题,本文提出一种基于能力边界意识的原则化多阶段训练策略,优化参数效率并提升幻觉鲁棒性。具体而言,我们重新设计了预训练策略以缓解语音-文本模态间的鸿沟,进而在对齐阶段与联合 SFT 之间引入迭代异步 SFT 阶段,以保持功能解耦并约束编码器表示漂移。在普通话和英文基准测试上的实验表明,我们的方法仅使用 23 亿参数即可达到与最先进模型相当的性能,同时通过解耦导向设计有效缓解了幻觉现象。
引用
@article{arxiv.2604.08003,
title = {Rethinking Entropy Allocation in LLM-based ASR: Understanding the Dynamics between Speech Encoders and LLMs},
author = {Yuan Xie and Jiaqi Song and Guang Qiu and Xianliang Wang and Ming Lei and Jie Gao and Jie Wu},
journal= {arXiv preprint arXiv:2604.08003},
year = {2026}
}