野生环境下的合成表格数据检测
机器学习
2025-03-05 v1 人工智能
数据库
神经与进化计算
机器学习
摘要
检测合成表格数据对于防止虚假或被操控的数据集分布至关重要,以免损害数据驱动决策。本研究探讨了是否可以在不同表格之间可靠地识别合成表格数据。这一挑战独特于表格数据,因其结构(如列数、数据类型和格式)可能因表格而异。我们提出了四种表格无关的检测器,结合简单的数据预处理方案,对其在六个评估协议上的性能进行评估,这些协议具有不同程度的“野生”程度。我们的结果表明,即使采用简单的数据预处理方案,在受限表格集合上进行跨表格学习是可能的。然而,它们确认跨表格迁移(即部署在未见过的表格上)具有挑战性。这表明需要更复杂的编码方案来处理此问题。
引用
@article{arxiv.2503.01937,
title = {Synthetic Tabular Data Detection In the Wild},
author = {G. Charbel N. Kindji and Elisa Fromont and Lina Maria Rojas-Barahona and Tanguy Urvoy},
journal= {arXiv preprint arXiv:2503.01937},
year = {2025}
}
备注
International Symposium on Intelligent Data Analysis, May 2025, Konstanz, Germany