中文

基于LLM的多说话人语音识别的两阶段门控交叉注意力适配器声学适配

声音 2026-03-31 v1

摘要

大型语言模型(LLM)在串行输出训练(SOT)的双说话人自动语音识别(ASR)中是强大的解码器,但在三说话人混合等挑战性条件下性能显著下降。关键限制在于当前系统仅通过投影前缀注入声学证据,这可能造成信息损失且与LLM输入空间对齐不完美,在解码过程中无法提供足够细粒度的锚定。解决这一限制对于鲁棒的多说话人ASR,尤其是三说话人混合场景至关重要。本文通过将说话人感知的声学证据显式注入解码器来改进基于LLM的多说话人ASR。我们首先重新审视基于连接时序分类(CTC)的前缀提示,并比较三种具有递增声学内容的变体。CTC信息通过我们先前工作中提出的序列化CTC获取。虽然声学富集的前缀优于仅SOT的基线,但仅前缀条件化对三说话人混合仍然不足。因此,我们提出一种轻量级门控残差交叉注意力适配器,并设计基于低秩更新(LoRA)的两阶段声学适配框架。在第一阶段,我们在自注意力子层之后插入门控交叉注意力适配器,以稳定地将声学嵌入作为外部内存注入。在第二阶段,我们通过参数高效的LoRA同时细化交叉注意力适配器和预训练LLM的自注意力投影,提高在有限数据下大型骨干网络的鲁棒性;学习到的更新在推理时合并到基础权重中。在干净和噪声条件下的Libri2Mix/Libri3Mix实验显示了持续增益,三说话人设置中提升尤为显著。

关键词

引用

@article{arxiv.2603.27205,
  title  = {Two-Stage Acoustic Adaptation with Gated Cross-Attention Adapters for LLM-Based Multi-Talker Speech Recognition},
  author = {Hao Shi and Yuan Gao and Xugang Lu and Tatsuya Kawahara},
  journal= {arXiv preprint arXiv:2603.27205},
  year   = {2026}
}