盲区质量:衡量机器学习系统部署覆盖风险的 Good-Turing 框架
机器学习
2026-04-08 v1 机器学习
摘要
盲区质量是衡量机器学习部署覆盖风险的 Good-Turing 框架。在现代机器学习系统中,操作状态分布常呈重尾分布,这意味着有效但罕见状态的长尾在有限的训练和评估数据中结构性地缺乏支持。这导致一种‘覆盖盲区’:模型在标准测试集上可能看起来准确,但在部署状态空间的大区域仍不可靠。我们提出盲区质量 B_n(tau),这是一种部署指标,估计其经验支持低于阈值 tau 的状态所分配的总概率质量。B_n(tau) 使用 Good-Turing 未见物种估计计算,给出操作分布中置于可靠性关键、缺乏支持领域的比例估计。我们进一步推导覆盖限制下的准确性上限,将总体性能分解为受支持成分和盲区成分,并区分容量限制与数据限制。我们在手腕佩戴式人体活动识别(HAR)中进行验证,使用手腕式惯性数据。随后在 MIMIC-IV 医院数据库中进行 275 例入院记录的分析,其中盲区质量曲线在 tau=5 时收敛至相同的 95%。这种在结构上独立的领域复制——差异体现在模态、特征空间、标签空间和应用——表明盲区质量是衡量组合覆盖风险的通用机器学习方法,而非特定于应用的副产品。盲区分解识别哪些活动或临床领域主导风险,为工业实践者提供可操作的指导,包括针对性数据收集、归一化/重新归一化以及针对更安全部署的物理或领域约束。
关键词
引用
@article{arxiv.2604.05057,
title = {Blind-Spot Mass: A Good-Turing Framework for Quantifying Deployment Coverage Risk in Machine Learning Systems},
author = {Biplab Pal and Santanu Bhattacharya and Madanjit Singh},
journal= {arXiv preprint arXiv:2604.05057},
year = {2026}
}
备注
15 pages, 7 figures, 1 table; submitted to Journal of Machine Learning Research (JMLR)