中文

我们真的能够将多说话人 ASR 语料库用于说话人分割吗?

音频与语音处理 2025-08-26 v2 声音

摘要

神经说话人分割在重叠说话人分割中被广泛应用,但需要大量多说话人数据进行训练。为满足这一数据需求,常通过组合多个语料库来构建大型数据集,包括最初为多说话人自动语音识别(ASR)设计的语料库。然而,ASR 数据集常常具有松散定义的段落边界,这些边界不符合说话人分割基准测试的更严格惯例。本文展示了这种边界松散性质如何显著影响说话人分割错误率,从而降低评估可靠性。我们还揭示,训练数据边界精度不同的模型会学习数据特定的松散性,导致其在跨域数据集上的泛化能力差。通过强制对齐实现标准化紧致边界的训练,不仅能提升说话人分割性能(尤其是流式场景),在简单后处理的条件下还能提升 ASR 性能。

关键词

引用

@article{arxiv.2507.09226,
  title  = {Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?},
  author = {Shota Horiguchi and Naohiro Tawara and Takanori Ashihara and Atsushi Ando and Marc Delcroix},
  journal= {arXiv preprint arXiv:2507.09226},
  year   = {2025}
}

备注

Accepted to IEEE ASRU 2025