中文

SDBench:面向说话人分割的全面基准套件

声音 2025-08-07 v2 人工智能 音频与语音处理

摘要

即使是最先进的说话人分割系统,在不同数据集上也表现出高大的误差率差异,这些数据集代表了诸多使用场景和领域。此外,跨系统比较需要谨慎地应用数据集划分和指标定义等最佳实践,以确保进行公正的比较。我们提出SDBench(Speaker Diarization Benchmark),一个开源的说话人分割基准套件,将整合13个多样化数据集,并内置工具,用于对各种设备端和服务器端系统的说话人分割性能进行一致且细粒度的分析。SDBench实现了可重复的评估,并能够轻松地在未来集成新的系统。为演示SDBench的有效性,我们构建了SpeakerKit,一个侧重推理效率的系统,基于Pyannote v3构建。SDBench使我们能够快速执行消融研究,使SpeakerKit相较于Pyannote v3速度提升了9.6倍,同时保持相当的误差率。我们对6个最先进的系统进行基准测试,包括Deepgram、AWS Transcribe和Pyannote AI API,揭示了准确率与速度之间的重要权衡。

关键词

引用

@article{arxiv.2507.16136,
  title  = {SDBench: A Comprehensive Benchmark Suite for Speaker Diarization},
  author = {Eduardo Pacheco and Atila Orhon and Berkin Durmus and Blaise Munyampirwa and Andrey Leonov},
  journal= {arXiv preprint arXiv:2507.16136},
  year   = {2025}
}