中文

野生环境下的合成表格数据检测

机器学习 2025-03-05 v1 人工智能 数据库 神经与进化计算 机器学习

摘要

检测合成表格数据对于防止虚假或被操控的数据集分布至关重要,以免损害数据驱动决策。本研究探讨了是否可以在不同表格之间可靠地识别合成表格数据。这一挑战独特于表格数据,因其结构(如列数、数据类型和格式)可能因表格而异。我们提出了四种表格无关的检测器,结合简单的数据预处理方案,对其在六个评估协议上的性能进行评估,这些协议具有不同程度的“野生”程度。我们的结果表明,即使采用简单的数据预处理方案,在受限表格集合上进行跨表格学习是可能的。然而,它们确认跨表格迁移(即部署在未见过的表格上)具有挑战性。这表明需要更复杂的编码方案来处理此问题。

关键词

引用

@article{arxiv.2503.01937,
  title  = {Synthetic Tabular Data Detection In the Wild},
  author = {G. Charbel N. Kindji and Elisa Fromont and Lina Maria Rojas-Barahona and Tanguy Urvoy},
  journal= {arXiv preprint arXiv:2503.01937},
  year   = {2025}
}

备注

International Symposium on Intelligent Data Analysis, May 2025, Konstanz, Germany