中文

掩码语言模型变为表格数据合成的条件密度估计

机器学习 2024-08-20 v2 计算与语言

摘要

本文旨在生成具有高机器学习实用性(MLu)的异构(混合类型)表格数据集。由于MLu性能取决于准确逼近条件分布,我们专注于基于条件分布估计来设计表格数据合成方法。我们通过重新定义掩码语言模型(MLM)的连续多分类任务,引入MaCoDE,将其视为基于直方图的非参数条件密度估计。我们的做法使我们能够估计任意目标变量和条件变量之间的条件密度。我们通过表明最小化无序多分类损失导致条件分布之间的总变差距离被最小化,弥合了分布学习与MLM之间的理论差距。为验证我们提出的模型,我们在10个真实数据集上评估其在合成数据生成中的性能,展示了其在不重新训练的情况下轻松调整数据隐私水平的能力。此外,由于MLM中的掩码输入标记类似于缺失数据,我们进一步评估了其在处理带有缺失值的训练数据集方面的有效性,包括对缺失条目进行多重插补。

关键词

引用

@article{arxiv.2405.20602,
  title  = {Masked Language Modeling Becomes Conditional Density Estimation for Tabular Data Synthesis},
  author = {Seunghwan An and Gyeongdong Woo and Jaesung Lim and ChangHyun Kim and Sungchul Hong and Jong-June Jeon},
  journal= {arXiv preprint arXiv:2405.20602},
  year   = {2024}
}