短时训练、长时推理:Speech-LLM 实现长音频零样本流式联合 ASR 与说话人分离
音频与语音处理
2025-11-21 v1
摘要
联合自动语音识别(ASR)与说话人分离旨在回答多说话人场景中的'谁说了什么'这一问题。本文提出了一种端到端语音大语言模型(Speech-LLM),用于联合流式说话人分离与自动语音识别(JEDIS-LLM)。该模型仅在 20 秒以下的短音频上进行训练,但能够在长音频上进行流式推理而无需额外训练。这是通过引入说话人提示缓存(SPC)实现的,该缓存在分块流式推理期间具有即时更新机制,其灵感来自 LLM 的自回归特性。SPC 还允许无缝使用预注册的说话人配置文件,这在许多场景(如会议转录)中很常见。为进一步提升说话人分离能力,我们在训练期间将词级说话人监督融入语音编码器。实验结果表明,我们的系统在 20 秒以内音频的本地设置上超越了强基线(包括 Sortformer 和 Meta-Cat),以及在长音频上的 DiarizationLM,尽管我们的系统是完全端到端且可流式的,而 DiarizationLM 遵循级联离线流水线。据我们所知,这是第一项使用仅训练于短音频的 Speech-LLM 实现长音频零样本流式联合 ASR 与说话人分离的工作,达到了最先进的性能。
引用
@article{arxiv.2511.16046,
title = {Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long Audio},
author = {Mohan Shi and Xiong Xiao and Ruchao Fan and Shaoshi Ling and Jinyu Li},
journal= {arXiv preprint arXiv:2511.16046},
year = {2025}
}
备注
Submitted to ICASSP2026