监控失效的概率学基础:从误报到结构性偏差
统计方法学
2025-12-29 v2 计算机与社会
概率论
定量方法
应用统计
摘要
数十年来,forensic statisticians一直在讨论巨大DNA数据库搜索是否削弱了匹配的证据价值。现代监控面临更加困难的问题:使用阈值规则而非精确匹配,对数千个属性对人口进行筛选。直觉认为,需要许多偶然匹配才应使误报几乎不可能。这一直觉是错误的。考虑一个监控1000个属性、每个属性的无罪匹配率为0.5%的系统。匹配15个预先指定的属性的概率为,即30个十亿分之一,几乎不可能。但实际系统无需如此特定。它们可能标记匹配\emph{任何}15个1000个属性之一的人。在一百万人的城市中,这会产生约226个误报。看似不可能的事件几乎必然发生。这并非实现缺陷,而是高维筛选的数学结果。我们确定了筛选可靠性的基本概率限制。系统在数据规模轻微增加时会从可靠转向不可靠,数据增长和相关性加剧了这种脆弱性。随着数据积累和相关性消失,有效维度下降,系统进入警报失去证据价值的 regime,即使单个偶然事件仍然极其罕见。这一框架重新定义了DNA数据库争议,作为不同运行 regime 之间的转换。不平等的监控暴露加剧了失效,使“结构性偏差”数学上不可避免。这些限制是结构性的:在临界规模之后,无法通过调整阈值或算法优化来防止失效。
引用
@article{arxiv.2511.12459,
title = {The Probabilistic Foundations of Surveillance Failure: From False Alerts to Structural Bias},
author = {Marco Pollanen},
journal= {arXiv preprint arXiv:2511.12459},
year = {2025}
}
备注
38 pages, 1 figure