用于合成金融数据的深度生成模型:在投资组合与风险建模中的应用
统计金融
2025-12-30 v2 人工智能
摘要
合成金融数据为隐私、可访问性和可重复性挑战提供了实用的解决方案,这些挑战通常制约着定量金融领域的实证研究。本文研究了深度生成模型的使用,特别是时间序列生成对抗网络(TimeGAN)和变分自编码器(VAE),以生成用于投资组合构建和风险建模应用的真实合成金融收益序列。以 S and P 500 的历史日收益率为基准,我们在可比的市场条件下生成合成数据集,并使用统计相似性指标、时间结构测试和下游金融任务对其进行评估。研究表明,TimeGAN 生成的合成数据在分布形状、波动率模式和自相关行为上均接近真实收益中观察到的特征。当应用于均值-方差投资组合优化时,所得的合成数据集产生的投资组合权重、夏普比率和风险水平均保持接近真实数据所得的结果。VAE 提供了更稳定的训练,但倾向于平滑极端的市场波动,这影响了风险估计。最后,分析支持将合成数据集作为投资组合分析和风险模拟中真实金融数据的替代品,特别是当模型能够捕捉时间动态时。因此,合成数据为金融实验和模型开发提供了一种保护隐私、高性价比且可重复的工具。
引用
@article{arxiv.2512.21798,
title = {Deep Generative Models for Synthetic Financial Data: Applications to Portfolio and Risk Modeling},
author = {Christophe D. Hounwanou and Yae Ulrich Gaba},
journal= {arXiv preprint arXiv:2512.21798},
year = {2025}
}
备注
14 pages, submitted as a preprint. This study examines generative models, specifically Time-series Generative Adversarial Networks (TimeGAN) and Variational Autoencoders (VAEs) for creating synthetic financial data to support portfolio construction, trading analysis, and risk modeling