IMAGIC-500:基于生成式虚构国家 (50万样本) 的 IMputation 基准
机器学习
2025-06-11 v1 计算工程、金融与科学
摘要
表格数据中的缺失数据插补是数据科学和机器学习中的关键挑战,尤其是在社会经济研究领域。然而,真实的社会经济数据集通常受严格的数据保护协议约束,这些协议往往禁止公开分享,即使是合成数据。这严重限制了该领域基准研究的可重复性和可访问性。此外,公开可用的合成数据集极少,导致社会经济数据集(无论真实数据还是合成数据)的插补方法评估缺乏可靠的基准。本研究利用世界银行公开的合成数据集 "为虚构国家生成的合成数据" 作为起点,该数据集紧密模拟了真实的世界银行家庭调查,同时完全公开,为方法学研究提供了广泛的访问途径。以此为基础,我们推导出 IMAGIC-500 数据集:从约 10 万户家庭中的 50 万名个体中抽取子集,包含 19 个社会经济特征,旨反映真实家庭调查的层次结构。本文在各种缺失机制 (MCAR、MAR、MNAR) 和缺失比例 (10%、20%、30%、40%、50%) 下,引入了 IMAGIC-500 上的全面缺失数据插补基准。我们的评估考虑插补对连续变量和分类变量的精度、计算效率以及对下游预测任务的影响,如在个体层面估计教育水平。结果揭示了统计方法、传统机器学习和深度学习插补技术(包括最新的扩散方法)的优势与不足。IMAGIC-500 数据集和基准旨在促进稳健插补算法的开发,并推动可重复的社会科学研究。
引用
@article{arxiv.2506.08844,
title = {IMAGIC-500: IMputation benchmark on A Generative Imaginary Country (500k samples)},
author = {Siyi Sun and David Antony Selby and Yunchuan Huang and Sebastian Vollmer and Seth Flaxman and Anisoara Calinescu},
journal= {arXiv preprint arXiv:2506.08844},
year = {2025}
}