中文

小数据下的算法问责:分类指标中由样本量引发的偏差

机器学习 2025-05-08 v1

摘要

评估机器学习模型不仅对于确定其技术准确性至关重要,而且对于评估其潜在的社会影响也至关重要。虽然算法中低样本量偏差的可能性是众所周知的,但我们证明了分类指标中由组合数学引起的样本量偏差的显著性。这一发现挑战了这些指标在高分辨率下评估偏差的有效性,尤其是在比较不同规模的群体时,这种情况在社会应用中经常出现。我们对几种常用指标中出现的偏差进行了分析,并提出了一种与模型无关的评估和校正技术。此外,我们分析了指标计算中未定义情况的计数,如果处理不当,可能导致误导性的评估。这项工作揭示了标准评估实践中先前未被认识到的组合数学和概率挑战,从而推进了执行公平和可信分类方法的技术。

关键词

引用

@article{arxiv.2505.03992,
  title  = {Algorithmic Accountability in Small Data: Sample-Size-Induced Bias Within Classification Metrics},
  author = {Jarren Briscoe and Garrett Kepler and Daryl Deford and Assefaw Gebremedhin},
  journal= {arXiv preprint arXiv:2505.03992},
  year   = {2025}
}

备注

AISTATS 2025