中文

关于生成式建模的因果保持能力

机器学习 2023-01-04 v1 计量经济学

摘要

建模是金融和保险行业广泛用于各类任务的核心。机器学习和深度学习模型的兴起与发展为改进我们的建模工具箱创造了诸多机会。这些领域的突破往往要求大量数据。此类大型数据集在金融和保险中通常并不公开,主要出于隐私和伦理考量。这种数据匮乏是当前开发更优模型的主要障碍之一。缓解该问题的一种可能选择是生成式建模。生成模型能够模拟虚假但看似真实的数据,亦称合成数据,可更自由地共享。生成对抗网络(GANs)正是这样一种模型,提升了我们拟合非常高维数据分布的能力。尽管 GANs 的研究在计算机视觉等领域是活跃课题,但其在经济学和保险等人文科学中采用有限。原因在于这些领域大多数问题本质上关乎因果效应的识别,而迄今为止作为 GAN 框架核心的神经网络主要聚焦于高维相关性。本文中我们研究 GANs 的因果保持能力,以及所产生的合成数据能否可靠地用于回答因果问题。这是通过对 GAN 生成的合成数据在假设愈发宽松的情况下进行因果分析来实现的。我们考虑横截面情形、时间序列情形以及具有完整结构模型的情形。结果表明,在相关即因果的简单横截面场景中 GAN 保持因果性,但在更高级的分析中会出现挑战。

关键词

引用

@article{arxiv.2301.01109,
  title  = {On the causality-preservation capabilities of generative modelling},
  author = {Yves-Cédric Bauwelinckx and Jan Dhaene and Tim Verdonck and Milan van den Heuvel},
  journal= {arXiv preprint arXiv:2301.01109},
  year   = {2023}
}