我们真的能够将多说话人 ASR 语料库用于说话人分割吗?
音频与语音处理
2025-08-26 v2 声音
摘要
神经说话人分割在重叠说话人分割中被广泛应用,但需要大量多说话人数据进行训练。为满足这一数据需求,常通过组合多个语料库来构建大型数据集,包括最初为多说话人自动语音识别(ASR)设计的语料库。然而,ASR 数据集常常具有松散定义的段落边界,这些边界不符合说话人分割基准测试的更严格惯例。本文展示了这种边界松散性质如何显著影响说话人分割错误率,从而降低评估可靠性。我们还揭示,训练数据边界精度不同的模型会学习数据特定的松散性,导致其在跨域数据集上的泛化能力差。通过强制对齐实现标准化紧致边界的训练,不仅能提升说话人分割性能(尤其是流式场景),在简单后处理的条件下还能提升 ASR 性能。
引用
@article{arxiv.2507.09226,
title = {Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?},
author = {Shota Horiguchi and Naohiro Tawara and Takanori Ashihara and Atsushi Ando and Marc Delcroix},
journal= {arXiv preprint arXiv:2507.09226},
year = {2025}
}
备注
Accepted to IEEE ASRU 2025