大数据洞察提取中的歧义、内置偏差与缺陷
物理与社会
2025-06-27 v1 统计力学
摘要
我提出了一个简化模型,以说明层次分类如何扭曲结果。该模型由标记为红、蓝或白色的离散像素组成。红色和蓝色表示不同的属性,白色代表未分类或模糊的数据。仅当一种颜色在像素中占据严格多数时,才会分配宏观颜色。否则,聚合被标记为白色,反映不确定性。这一设置模拟了五十 percent 的 percolation 阈值。由于从数据中不可直接获取各种颜色比例,我实现了一种层次粗化程序。元素(首先是像素,然后是聚合)被递归分组并通过局部多数规则重新分类,最终产生一个单一的超聚合,其颜色代表整个像素集合的推断宏观属性。分析结果,得到模拟支持,表明该过程在最初存在白色聚合的基础上引入了额外的白色聚合,这些聚合源自缺乏明确多数的组别,需通过任意对称性中断决策来分配颜色。虽然每次局部决策看似微小且无关紧要,但其重复引入日益增长的系统性偏差。即使数据完整,局部规则中不可避免的不对称性也会扭曲结果。该研究突显了递归数据简化的关键局限性。洞察提取不仅受数据质量影响,还受局部歧义处理方式的影响。结果导致内置偏差。因此,相关缺陷并非源于数据本身,而是源于在局部聚合过程中所做出的结构性选择。虽然基于简单模型,但该研究揭示了广泛使用的层次分类技术中固有缺陷的高可能性。
关键词
引用
@article{arxiv.2506.21262,
title = {Ambiguities, Built-in Biases and Flaws in Big Data Insight Extraction},
author = {Serge Galam},
journal= {arXiv preprint arXiv:2506.21262},
year = {2025}
}
备注
26 pages, 9 figures