中文

大规模公共卫生流中的异常值排序

人工智能 2024-01-04 v1

摘要

疾病控制专家每天检查公共卫生数据流以寻找值得调查的异常值,例如那些对应于数据质量问题或疾病爆发的异常值。然而,在对大规模公共卫生数据流应用单变量异常检测方法时,他们只能检查返回的数千个最大关联异常值中的一小部分。为了帮助专家从这些数千个关联异常值中区分出最重要的异常值,我们提出了一项新任务,即对应用于许多流的任何单变量方法的输出进行排序。我们针对此任务提出的新算法利用了分层网络和极值分析,在使用公共卫生数据流进行的人类专家评估中,其在传统异常检测指标上表现最佳。最重要的是,自 2023 年 4 月以来,专家们一直使用我们的开源 Python 实现,并报告称识别值得调查的异常值的速度比其先前基线快了 9.1 倍。其他组织可以轻松调整此实现,以便在其定制的单变量方法 Across 大规模流的输出中创建排序。

关键词

引用

@article{arxiv.2401.01459,
  title  = {Outlier Ranking in Large-Scale Public Health Streams},
  author = {Ananya Joshi and Tina Townes and Nolan Gormley and Luke Neureiter and Roni Rosenfeld and Bryan Wilder},
  journal= {arXiv preprint arXiv:2401.01459},
  year   = {2024}
}

备注

6 figures, 8 pages