中文

对数据生成过程建模是分布外泛化所必需的

机器学习 2024-05-21 v4 人工智能

摘要

近期关于域泛化(domain generalization, DG)的实证研究表明,在某些分布偏移上表现良好的 DG 算法在其他偏移上表现不佳,且没有一种最先进的 DG 算法能在所有偏移上持续表现良好。此外,真实世界数据往往在不同属性上存在多种分布偏移;因此我们引入了多属性分布偏移数据集,并发现现有 DG 算法的准确率进一步下降。为解释这些结果,我们使用一个典型因果图对多属性偏移下的泛化进行了形式化刻画。基于伪属性与分类标签之间的关系,我们获得了典型因果图的具体实现,这些实现刻画了常见的分布偏移,并表明每种偏移都对观测变量施加了不同的独立性约束。因此,我们证明任何基于单一固定约束的算法都无法在所有偏移上表现良好,为 DG 算法的混合实证结果提供了理论依据。基于这一洞见,我们开发了因果自适应约束最小化(Causally Adaptive Constraint Minimization, CACM)算法,该算法利用关于数据生成过程的知识来自适应地识别并应用正确的独立性约束进行正则化。在完全合成、MNIST、small NORB 和 Waterbirds 数据集上的结果(涵盖二值与多值属性及标签)表明,自适应的依赖于数据集的约束在未见域上取得了最高准确率,而错误的约束则无法做到这一点。我们的结果证明了建模数据生成过程中固有因果关系的重要性。

关键词

引用

@article{arxiv.2206.07837,
  title  = {Modeling the Data-Generating Process is Necessary for Out-of-Distribution Generalization},
  author = {Jivat Neet Kaur and Emre Kiciman and Amit Sharma},
  journal= {arXiv preprint arXiv:2206.07837},
  year   = {2024}
}

备注

Published at ICLR 2023