欧洲区域统计无监督机器学习用于检测结构异常
机器学习
2026-05-05 v1
摘要
确保区域社会经济统计的一致性是国家统计局的核心任务。传统验证工具,如范围编辑、比率检查或单变量异常检测,虽然适用于识别单个序列中的极端值,但在检测高维环境下异常指数组合方面不够。本文提出了一个无监督机器学习框架,用于识别欧洲 NUTS2 区域内结构异常的轮廓。我们构建了覆盖 2022 年 NUTS2 区域的横截面数据集,涵盖四个关键指标:购买力平价 GDP 每人,失业率,高等教育水平和人口密度。我们应用并比较了五种异常检测技术:单变量 z 分数、马哈拉诺斯距离、孤立森林、局部离群因子和单类支持向量机(One-Class SVM),并将被至少三种方法标记的区域定义为结构异常。研究结果表明,机器学习方法识别出一组一致的区域,其多变量轮廓与欧盟整体模式显著不同。这些包括高度发达的大都市经济体(布鲁塞尔、维也纳、柴林、布拉格)以及持续社会经济劣势地区(西斯洛维尼亚中部和西部、匈牙利北部、西班牙 Leon 省、Extremadura),以及伊斯坦布尔,其轮廓与欧盟首都地区不同。重要的是,这些异常不一定表示数据质量问题;相反,它们反映出值得分析或政策关注的有意义的结构性差异。该框架完全可复现、可扩展,且与现有验证工作流程兼容,为在欧洲统计体系中早期检测异常区域配置提供了灵活工具。
引用
@article{arxiv.2605.02884,
title = {Unsupervised Machine Learning for Detecting Structural Anomalies in European Regional Statistics},
author = {Bogdan Oancea},
journal= {arXiv preprint arXiv:2605.02884},
year = {2026}
}