SAGE:稀疏自适应引导用于依赖感知的表格数据生成
机器学习
2026-04-28 v1
摘要
生成高保真合成表格数据仍是提升隐私敏感和资源有限领域数据可得性的关键挑战。最近的研究方法通过将表格行表示为序列来利用大语言模型,却存在两个根本局限:(1) 它们稠密建模特征依赖,引入虚假相关性;(2) 它们假设特征之间为静态关系,忽略了这些依赖随特征值而变化的特性。为克服这些局限,我们引入SAGE(稀疏自适应引导),一种新型基于大语言模型的生成框架,通过强制稀疏和动态依赖引导。SAGE将特征离散化为价值感知的伪特征,并构建基于互信息的稀疏依赖图。该图通过显式上下文选择或隐式logit校正来自适应引导生成,使LLM在合成过程中专注于真正相关的信息。我们的广泛实验覆盖六个数据集和多个任务,结果表明SAGE不仅提升了数据保真度和下游效用,将F1分数提升了10%,还将政策违规减少一个百分点。这些结果凸显了表格数据生成中自适应结构的重要性,为理解LLM的上下文敏感控制提供了新见解。
引用
@article{arxiv.2604.24368,
title = {SAGE: Sparse Adaptive Guidance for Dependency-Aware Tabular Data Generation},
author = {Shuo Yang and Zheyu Zhang and Bardh Prenkaj and Gjergji Kasneci},
journal= {arXiv preprint arXiv:2604.24368},
year = {2026}
}
备注
Accepted by ACL 2026