通过 Bandit Networks 提升组合投资组合优化效果
人工智能
2024-10-10 v2 投资组合管理
摘要
在强化学习 (RL) 中,多臂赭枢 (MAB) 问题已在推荐系统、医疗和金融等领域找到应用。传统 MAB 算法通常假设奖励分布为平稳的,这限制了其在现实场景中非平稳动态环境下的效果。本文通过引入和评估新颖的针对非平稳环境设计的 Bandit 算法来解决这一限制。首先,我们提出了自适应折扣 Thompson 采样 (ADTS) 算法,通过放宽折扣机制和滑动窗口机制来增强对奖励分布变化的适应性。随后,我们将该方法扩展到组合投资组合问题,引入组合自适应折扣 Thompson 采样 (CADTS) 算法,以解决组合 Bandit 中的计算挑战并改进动态资产配置。此外,我们提出一种新型架构称为 Bandit Networks,将 ADTS 和 CADTS 的输出集成在一起,从而缓解股票选择中的计算限制。通过使用真实金融市场数据的大量实验,我们展示了这些算法和架构在适应动态环境和优化决策过程方面的潜力。例如,提出的 bandit network 实例在比较经典的组合投资组合方法(如资本资产定价模型、等权、风险 Parity 和马科维茨)时表现更佳,最佳网络相较于最佳经典模型的样本外 Sharpe 比率提高了 20%。
引用
@article{arxiv.2410.04217,
title = {Improving Portfolio Optimization Results with Bandit Networks},
author = {Gustavo de Freitas Fonseca and Lucas Coelho e Silva and Paulo André Lima de Castro},
journal= {arXiv preprint arXiv:2410.04217},
year = {2024}
}