中文

将面部密度用作数据复杂度的代理指标: 量化实例计数的难度

计算机视觉与模式识别 2026-04-15 v2 人工智能 机器学习

摘要

机器学习进展历史上聚焦于模型中心创新,但可实现的性能常被数据本身的内在复杂度所限制。本文孤立并量化面部密度 (以面部数量衡量) 作为数据复杂度的主要驱动因素。我们并未仅仅观察到“拥挤场景更难”,而是通过严格控制类别失衡来度量密度alone 所致的精确退化。对 WIDER FACE 和 Open Images 数据集进行受控实验,限制在恰好 1 到 18 个面部/图像的范围内,并进行完美平衡的抽样,结果显示模型性能随面部数量单调下降。该趋势在分类、回归和检测范式中均成立,即使模型完全暴露于整个密度范围之内。进一步地,我们表明在低密度 regime 中训练的模型难以泛化到更高密度,表现出系统性的低估偏差,错误率可提高最高 4.6 倍,这表明密度 Acts as a domain shift。这些发现将实例密度确立为数据硬度的内在、可量化维度,并激励在课程学习和密度分层评估中的特定干预。

关键词

引用

@article{arxiv.2604.09689,
  title  = {Face Density as a Proxy for Data Complexity: Quantifying the Hardness of Instance Count},
  author = {Abolfazl Mohammadi-Seif and Ricardo Baeza-Yates},
  journal= {arXiv preprint arXiv:2604.09689},
  year   = {2026}
}

备注

This work has been accepted for publication in the Proceedings of IEEE CAI 2026. The final published version should be cited