JANUS:用于保证约束与分析不确定性的结构化双向生成
机器学习
2026-03-05 v1 人工智能
摘要
高风险的合成数据生成面临一个根本性四难问题:在保真性、对复杂逻辑约束的控制、不确定性估计的可靠性以及计算成本的效率之间同时实现。现有的深度生成模型(如 CTGAN、TabDDPM)在保真性方面表现优异,但依赖低效的拒绝抽样处理连续范围约束。相反,结构因果模型在逻辑控制方面优势显著,但在高维保真性和复杂噪声反演方面存在挑战。我们提出 JANUS(Joint Ancestral Network for Uncertainty and Synthesis,联合祖先网络用于不确定性与合成),一个将这些能力统一的框架,基于贝叶斯决策树构建的有向无环图(DAG)。我们的关键创新是逆拓扑回填(Reverse-Topological Back-filling),一种算法通过因果图向后传递约束,实现可行约束集上 100% 约束满足,无需拒绝抽样。这一方法配合从 Dirichlet 先验派生的解析不确定性分解,使不确定性估计比蒙特卡罗方法快 128 倍。在 15 个数据集和 523 种约束情景下,JANUS 实现了最新的保真性(检测分数 0.497),消除了不平衡数据中的模式坍缩,并能精确处理复杂列间约束(如 Salary_offered >= Salary_requested),在此类场景下所有基线方法均无法实现。
引用
@article{arxiv.2603.03748,
title = {JANUS: Structured Bidirectional Generation for Guaranteed Constraints and Analytical Uncertainty},
author = {Taha Racicot},
journal= {arXiv preprint arXiv:2603.03748},
year = {2026}
}
备注
14 pages, 10 figures, 14 tables