SE-DiCoW:自 Enrollment 语音分割条件化 Whisper
音频与语音处理
2026-01-28 v1 机器学习
摘要
多说话人环境下基于说话人归因的自动语音识别 (ASR) 仍然是面临重大挑战的难题。虽然有些方法在针对特定领域进行微调后能取得优异性能,但鲜有系统能在跨域数据集上实现良好泛化。我们的前期工作——语音分割条件化 Whisper (Diarization-Conditioned Whisper, DiCoW) 利用语音分割输出作为条件化信息,并通过最小化调参即可展现出强大的多语言和跨域性能。在本文中,我们针对 DiCoW 的一个关键局限性——静默-目标-非目标-重叠 (Silence-Target-Non-target-Overlap, STNO) 掩码的歧义问题进行改进,即在两种或以上完全重叠的说话人可能因表述不同而几乎相同条件的情况下。我们引入 SE-DiCoW (Self-Enrolled Diarization-Conditioned Whisper),通过语音分割输出定位对话中目标说话人最活跃的任一 enrollment 片段。该 enrollment 片段作为固定条件化信息,通过跨注意力机制在每个编码器层中使用。我们进一步对 DiCoW 进行数据分段、模型初始化和数据增强方面的改进。综合上述措施,SE-DiCoW 在 EMMA MT-ASR 基准测试中相较于原始 DiCoW 将宏平均 tcpWER 降低 52.4%。
关键词
引用
@article{arxiv.2601.19194,
title = {SE-DiCoW: Self-Enrolled Diarization-Conditioned Whisper},
author = {Alexander Polok and Dominik Klement and Samuele Cornell and Matthew Wiesner and Jan Černocký and Sanjeev Khudanpur and Lukáš Burget},
journal= {arXiv preprint arXiv:2601.19194},
year = {2026}
}
备注
Accepted to ICASSP 2026