中文

评估预测系统并降低其告警负担的新技术

机器学习 2022-11-30 v3 信息检索

摘要

机器预测算法(如二分类器)常基于所宣称的性能(使用灵敏度与预测值等经典指标)被采用。然而分类器性能严重依赖于分类器所处上下文(工作流)。除非满足某些隐含假设,经典指标并不能反映预测器的实际效用,而在许多常见临床场景中这些假设无法成立。这常导致次优实现,并在预期结果未达成时令人失望。当对同一事件可作出多次预测时,尤其当冗余的真阳性预测几乎不产生额外价值时,经典指标的一种常见失效模式便会出现。这描述了许多临床告警系统。我们解释经典指标为何不能在此类上下文中正确表征预测器性能,并引入一种改进的性能评估技术,利用效用函数依据预测在特定工作流上下文中的效用进行评分。所得效用指标(u-metrics)显式考虑了时间关系对预测效用的影响。相比传统度量,u-metrics 更准确地反映预测器在真实临床上下文中运行的真实成本与收益。改进可能十分显著。我们还描述一种形式化的 snoozing(休眠抑制)方法,作为一种缓解策略,通过抑制部分预测以降低假阳性同时保留事件捕获,从而提升预测器性能。Snoozing 对产生打断式告警的预测器尤为有用。U-metrics 能正确度量并预测 snoozing 的性能收益,而传统指标不能。

关键词

引用

@article{arxiv.2102.05691,
  title  = {Novel Techniques to Assess Predictive Systems and Reduce Their Alarm Burden},
  author = {Jonathan A. Handler and Craig F. Feied and Michael T. Gillam},
  journal= {arXiv preprint arXiv:2102.05691},
  year   = {2022}
}

备注

12 pages, 5 figures, 10 tables