中文

说话人日志模型基准评测

声音 2025-10-01 v1 机器学习

摘要

说话人日志是一项根据说话人身份将音频分割成不同片段的任务,旨在回答多人对话录音中“谁在何时说话”的问题。尽管说话人日志是许多下游应用的基础任务,但它仍是一个未解决的问题。日志中的错误会传播到下游系统,并导致广泛的故障。为此,我们通过评估五个最先进的说话人日志模型,在涵盖多种语言和声学条件的四个说话人日志数据集上,考察了确切的失败模式。评估数据集包含 196.6 小时的多语言音频,包括英语、普通话、德语、日语和西班牙语。总体而言,我们发现 PyannoteAI 以 11.2% 的 DER 取得了最佳性能,而 DiariZen 以 13.3% 的 DER 提供了一个有竞争力的开源替代方案。在分析失败案例时,我们发现说话人日志错误的主要原因是遗漏语音片段,其次是说话人混淆,尤其是在说话人数量较多的场景中。

关键词

引用

@article{arxiv.2509.26177,
  title  = {Benchmarking Diarization Models},
  author = {Luca A. Lanzendörfer and Florian Grötschla and Cesare Blaser and Roger Wattenhofer},
  journal= {arXiv preprint arXiv:2509.26177},
  year   = {2025}
}