基于情景-上下文展开的组合强化学习
人工智能
2026-03-02 v1
摘要
市场情势转变会引起分布性偏移,从而可能降低组合再平衡政策的性能。我们提出宏观条件情景-上下文展开(SCR)方法,以生成压力事件下的可信下一日多变量回报情景。然而,这面临新挑战,因为历史数据永远无法告诉我们若干处于不同情形时会发生什么。结果是,引入基于情景的奖励进行展开会在时序差学习中引入奖励-状态转移不匹配,导致 RL 评估网络训练不稳定。我们分析了这种不一致性,证明它导致混合评估目标。导师化这一分析,我们构建一种使用展开暗示的后续状态的反事实下一状态,并增强评估网络的引导目标。这样既稳定了学习,又提供了可行的偏差-方差权衡。在对 31 个美国股票和 ETF 投资组合的样本外评估中,我们的方法将夏普比率提高最高可达 76%,最大回撤降低最高可达 53%,显著优于经典和基于强化学习的组合再平衡基准。
引用
@article{arxiv.2602.24037,
title = {Portfolio Reinforcement Learning with Scenario-Context Rollout},
author = {Vanya Priscillia Bendatu and Yao Lu},
journal= {arXiv preprint arXiv:2602.24037},
year = {2026}
}