BOSARIS工具包:应对新DCF的理论、算法与代码
应用统计
2013-04-11 v1 机器学习
机器学习
摘要
NIST SRE'10的“新DCF”相对于“旧DCF”评估准则的两个数量级的变化,给参与者和评估者都带来了严峻挑战。最初,参与者不知道如何校准他们的系统,而评估者低估了所需的评估试验次数。事后看来,现在很明显,校准和评估都需要非常大的试验集。这带来了以下挑战:(i) 如何确定足够的试验次数,以及 (ii) 如何在合理的内存和CPU需求下处理如此大的数据集。在SRE'10之后,在BOSARIS研讨会上,我们将这些问题的解决方案构建到了免费提供的BOSARIS工具包中。本文解释了该工具包背后的原理和算法。该工具包的主要贡献是:1. 归一化贝叶斯错误率图,它分析了大范围DCF操作点上的似然比校准。这些图还有助于判断校准和评估数据库规模是否足够。2. 高效算法,用于在这些图所需的操作点范围内计算大型得分文件的DCF和minDCF。3. 一种新的得分文件格式,便于处理非常大的试验列表。4. 用于融合和校准的更快逻辑回归优化器。5. 一种定义EER(等错误率)的原则性方法,当绝对错误计数较小时具有实际意义。
引用
@article{arxiv.1304.2865,
title = {The BOSARIS Toolkit: Theory, Algorithms and Code for Surviving the New DCF},
author = {Niko Brümmer and Edward de Villiers},
journal= {arXiv preprint arXiv:1304.2865},
year = {2013}
}
备注
presented at: The NIST SRE'11 Analysis Workshop, Atlanta, December 2011