中文

BER:用于说话人日志的平衡错误率

声音 2022-11-09 v1 计算与语言 音频与语音处理

摘要

DER 是评估日志化性能的主要指标,但它面临一个困境:短话语或片段中的错误往往被较长的话语或片段所淹没。短片段,例如“是”或“否”,仍然具有语义信息。此外,DER 忽略了说话较少的说话人中的错误。尽管 JER 平衡了说话人错误,但它仍然面临同样的困境。考虑到所有这些方面,即时长错误、片段错误和说话人加权错误构成了一个完整的日志化评估,我们提出了一种平衡错误率(BER)来评估说话人日志化。首先,我们通过连通子图和自适应 IoU 阈值提出了一种片段级错误率(SER),以获得准确的片段匹配。其次,为了以统一的方式评估日志化,我们采用说话人特定的时长和片段之间的调和平均,然后进行说话人加权平均。第三,我们通过模块化系统、EEND 以及在真实数据集上的多模态方法分析了我们的指标。SER 和 BER 已在 https://github.com/X-LANCE/BER 上公开可用。

关键词

引用

@article{arxiv.2211.04304,
  title  = {BER: Balanced Error Rate For Speaker Diarization},
  author = {Tao Liu and Kai Yu},
  journal= {arXiv preprint arXiv:2211.04304},
  year   = {2022}
}

备注

5 pages, 2 figures