中文

开源合成数据SDK:实现表格数据的民主化

机器学习 2025-11-14 v2

摘要

机器学习开发严重依赖高质量数据的获取。然而,由于隐私、 Proprietary 利益及伦理顾虑日益增长,数据获取面临显著障碍。合成数据作为一种可行方案,能够在不泄露敏感信息的前提下实现安全的、广泛的数据使用。本文提出了MOSTLY AI合成数据软件开发套件(Synthetic Data SDK),这是一款专为合成高质量表格数据而设计的开源工具包。SDK集成了鲁棒的功能,如差分隐私保证、公平性感知数据生成以及自动化质量保证,具备灵活且易用的Python接口。该SDK基于TabularARGN自回归框架,支持多样化的数据类型和复杂的多表格及序列数据集,性能具有竞争力,并在速度和可用性方面实现显著提升。目前该SDK既作为云服务交付,又可本地安装使用,已见证快速采纳,凸显其在实际中解决数据瓶颈、促进数据民主化方面的实用性。

关键词

引用

@article{arxiv.2508.00718,
  title  = {Democratizing Tabular Data Access with an Open$\unicode{x2013}$Source Synthetic$\unicode{x2013}$Data SDK},
  author = {Ivona Krchova and Mariana Vargas Vieyra and Mario Scriminaci and Andrey Sidorenko},
  journal= {arXiv preprint arXiv:2508.00718},
  year   = {2025}
}