生成模型外推的独立机制理论
机器学习
2022-01-03 v2 计算机视觉与模式识别
机器学习
摘要
生成模型可被训练以模拟复杂的经验数据,但它们是否有助于在先前未观测到的环境中进行预测?促进此类外推能力的一个直观想法是使此类模型的架构反映真实数据生成过程的因果图,从而可以对每个节点独立地实施干预。然而,该图的节点通常不可观测,导致过参数化以及因果结构不可辨识。我们发展了一个理论框架,通过基于机制独立性原理定义一种较弱的辨识形式来应对这一挑战性情形。我们在玩具示例上证明,经典的随机梯度下降会阻碍模型的外推能力,这表明机制独立性应在训练期间被显式强制。在真实世界数据上训练的深度生成模型实验支持了这些见解,并说明了此类模型的外推能力如何被利用。
引用
@article{arxiv.2004.00184,
title = {A theory of independent mechanisms for extrapolation in generative models},
author = {Michel Besserve and Rémy Sun and Dominik Janzing and Bernhard Schölkopf},
journal= {arXiv preprint arXiv:2004.00184},
year = {2022}
}
备注
21 pages