中文

稀疏和准结构化混合类型数据的自回归合成

机器学习 2026-05-01 v2

摘要

合成数据生成是隐私保护数据共享、系统基准测试和测试数据 provisioning 重要的能力。对于混合类型数据,现有合成器主要针对稠密、固定模式的表格,但许多现代数据系统存储和交换稀疏、准结构化 JSON,包含嵌套对象、可变长度数组和可选键。将表格合成器应用于此类数据需要将记录展平为宽稀疏表格,将嵌套结构和数组转化为列布局副产品。我们提出 ORiGAMi,一种用于建模和合成准结构化记录的自回归变换器架构,无需展平。ORiGAMi 将 JSON 记录序列化为 key、value 和结构 token,并通过文档树中的路径编码 token 位置。语法和 schema 约束强制生成 syntactically 有效的 JSON 和数据集一致的结构。我们在六个数据集上评估 ORiGAMi,涵盖从稠密表格基准到大规模准结构化集合的各种数据。对于 fidelity、detection 和 utility 指标,ORiGAMi 在 17 个基准比较中取得最佳得分,同时在所有设置下保持 96% 以上的高隐私得分。这一结果确立了原生记录建模为替代表格合成管道的强有力选项,既保留结构又实现了最先进的基准性能。

关键词

引用

@article{arxiv.2603.01444,
  title  = {Autoregressive Synthesis of Sparse and Semi-Structured Mixed-Type Data},
  author = {Thomas Rückstieß and Robin Vujanic},
  journal= {arXiv preprint arXiv:2603.01444},
  year   = {2026}
}

备注

Under Submission