SpeakerLM:基于多模态大语言模型的端到端通用说话人框图与识别
声音
2026-01-06 v3 人工智能
摘要
说话人框图与识别(SDR)任务旨在预测音频剪辑中“谁说了什么以及何时说的”,这是许多实际场景中关键任务,如会议转录和对话系统。现有 SDR 系统通常采用级联框架,结合多个模块,如说话人框图(SD)和自动语音识别(ASR)。级联系统存在若干局限性,如误差传播、难以处理重叠语音以及缺乏对 SD 与 ASR 任务之间协同作用的联合优化。为解决这些问题,我们引入 SpeakerLM,这是一个用于 SDR 的统一多模态大语言模型,能够端到端地同时执行 SD 和 ASR。此外,为便于多样化的实际场景,我们将灵活的说话人注册机制纳入 SpeakerLM,使其能够在不同的说话人注册设置下进行 SDR。SpeakerLM 采用多阶段训练策略在大规模真实数据上逐步开发。广泛的实验表明,SpeakerLM 具备强大的数据扩展能力和通用性,在两个域内和跨域的公开 SDR 基准测试中均优于最先进的级联基线。此外,实验结果表明,提出的说话人注册机制有效确保了 SpeakerLM 在多样化的说话人注册条件和不同数量的已注册说话人下的稳健 SDR 性能。
引用
@article{arxiv.2508.06372,
title = {SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models},
author = {Han Yin and Yafeng Chen and Chong Deng and Luyao Cheng and Hui Wang and Chao-Hong Tan and Qian Chen and Wen Wang and Xiangang Li},
journal= {arXiv preprint arXiv:2508.06372},
year = {2026}
}
备注
Accepted by AAAI 2026