适应说话人条件化 Whisper 进行端到端多说话人语音识别
音频与语音处理
2026-02-05 v2 计算与语言
声音
摘要
我们提出了一种基于说话人归因 (SA) 的 Whisper 模型,用于多说话人语音识别,该模型结合了目标说话人建模与序列化输出训练 (SOT)。我们的做法利用说话人条件化 Whisper (DiCoW) 编码器提取目标说话人嵌入,这些嵌入被拼接成单个表示并传递给共享解码器。这使得模型能够以序列化输出流形式转录重叠语音,包含说话人标签和时间戳。与 DiCoW 等目标说话人 ASR 系统不同,后者分别解码每个说话人,而我们的方法进行联合解码,允许解码器同时以所有说话人的上下文为条件。实验表明,该模型在多说话人混合信号上(例如 LibriMix)的表现优于现有的 SOT 方法,并超越 DiCoW。
引用
@article{arxiv.2510.03723,
title = {Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition},
author = {Martin Kocour and Martin Karafiat and Alexander Polok and Dominik Klement and Lukáš Burget and Jan Černocký},
journal= {arXiv preprint arXiv:2510.03723},
year = {2026}
}