用于增强金融建模的合成金融数据生成
机器学习
2025-12-29 v1 计算金融
摘要
金融领域的数据稀缺和机密性问题常常阻碍模型开发和稳健测试。本文提出了一个用于合成金融数据的统一多准则评估框架,并将其应用于三种代表性的生成范式:统计 ARIMA-GARCH 基线、变分自编码器 (VAE) 和时间序列生成对抗网络 (TimeGAN)。使用历史标普 500 每日数据,我们评估了保真度(最大均值差异,MMD)、时间结构(自相关和波动率聚类)以及在下游任务中的实际效用,特别是均值-方差投资组合优化和波动率预测。实证结果表明,ARIMA-GARCH 捕获了线性趋势和条件波动率,但未能再现非线性动态;VAE 产生了低估极端事件的平滑轨迹;而 TimeGAN 在真实性和时间相干性之间实现了最佳权衡(例如,TimeGAN 取得了最低的 MMD:1.84e-3,在 5 个随机种子上取平均)。最后,我们阐述了根据应用需求和计算约束选择生成模型的实用指南。我们的统一评估协议和可复现代码库旨在标准化合成金融数据研究中的基准测试。
引用
@article{arxiv.2512.21791,
title = {Synthetic Financial Data Generation for Enhanced Financial Modelling},
author = {Christophe D. Hounwanou and Yae Ulrich Gaba and Pierre Ntakirutimana},
journal= {arXiv preprint arXiv:2512.21791},
year = {2025}
}
备注
23 pages, 7 figures, 6 tables. Submitted as a preprint. This work presents a unified multi-criteria evaluation framework for synthetic financial data, applied to ARIMA-GARCH, VAEs, and TimeGAN models