中文

您的离线策略不可信:基于双层强化学习的序列投资组合优化

机器学习 2025-05-20 v1

摘要

强化学习(RL)在序列投资组合优化任务中显示出巨大的潜力,如股票交易,其中目标是最大化累积收益,同时最小化风险,使用历史数据。然而,传统RL方法常产生仅记忆固定数据集中最优且不切实际的买卖行为的策略。这些离线策略的可泛化性较差,因为它们未能考虑市场非平稳性。我们的方法MetaTrader将投资组合优化建模为一种新的部分离线RL问题,并作出两个技术贡献。首先,MetaTrader采用双层学习框架,显式训练RL代理在原始数据集上的领域利润以及在原始金融数据的多样化转换上的外域性能。其次,我们的方法包含一种新的时序差(TD)方法,用于近似一批转换TD目标的最小TD估计,解决了在数据有限的场景中特别具有挑战性的价值高估问题。我们在两个公共股票数据集上的实验表明,MetaTrader在现有方法(包括RL方法和传统股票预测模型)之上具有优势。

关键词

引用

@article{arxiv.2505.12759,
  title  = {Your Offline Policy is Not Trustworthy: Bilevel Reinforcement Learning for Sequential Portfolio Optimization},
  author = {Haochen Yuan and Minting Pan and Yunbo Wang and Siyu Gao and Philip S. Yu and Xiaokang Yang},
  journal= {arXiv preprint arXiv:2505.12759},
  year   = {2025}
}