将 LLM 语义先验蒸馏到基于 Talker-Count Routing 的编码器-only 多说话人语音识别
声音
2026-03-12 v1
摘要
大型语言模型 (LLM) 提供的强语义先验可以提高多说话人自动语音识别 (MT-ASR) 的性能,但将 LLM 作为自回归解码器代价高昂且在重叠严重时仍显脆弱。本文提出一种编码器-only MT-ASR 框架,将 LLM 适配到多说话人条件下,并在训练期间将其语义指导蒸馏到编码器中,同时保留推理时的快速 CTC 风格解码。我们的模型采用后编码器分离器配合序列化 CTC 生成说话人有序的转录文本,并利用基于 LLM 的 SOT 目标作为多说话人感知的教师信号,以显式正则化混合语音表征。为进一步支持可变数量的说话人,我们引入一个 Talker-Count Head 预测说话人数量并动态选择合适的解码分支。在 LibriMix 数据集上实验表明,所提出的编码器-only 模型在两说话人条件下可与 LLM-based 系统保持相当性能,而在三说话人条件下实现显著提升,同时 RTF 较小。
引用
@article{arxiv.2603.10587,
title = {Distilling LLM Semantic Priors into Encoder-Only Multi-Talker ASR with Talker-Count Routing},
author = {Hao Shi and Yusuke Fujita and Roman Koshkin and Mengjie Zhao and Yuan Gao and Lianbo Liu and Yui Sudo},
journal= {arXiv preprint arXiv:2603.10587},
year = {2026}
}