中文

基于奖励因子矩阵和多Critic 框架的因子-MCLS:用于动态投资组合优化的多智能体学习系统

机器学习 2025-04-17 v1

摘要

典型的深度强化学习(DRL)代理通过分析奖励函数输出值来学习影响投资组合收益和风险的因素,同时在训练环境中调整投资组合权重。然而,这面临一个主要限制,即投资者难以根据对各投资组合资产的不同风险厌恶程度干预训练。这种困难源于另一个限制:现有的 DRL 代理可能仅通过学习奖励函数的输出而不深入理解导致投资组合收益和风险的因素。结果是,确定目标投资组合权重的策略完全依赖于 DRL 代理本身。为解决这些限制,我们提出了用于阐明每个资产在投资组合中的收益和风险的奖励因子矩阵。此外,我们提出了一个名为 Factor-MCLS 的新型学习系统,该系统采用多Critic 框架来促进奖励因子矩阵的学习。通过这种方式,我们的 DRL 基于学习的系统能够有效学习影响投资组合收益和风险的因素。更重要的是,基于多Critic 框架中的 Critic 网络,我们在策略函数的训练目标函数中开发了一个风险约束项。该风险约束项允许投资者根据其对投资组合资产的个人风险厌恶程度干预 DRL 代理的训练。

关键词

引用

@article{arxiv.2504.11874,
  title  = {Factor-MCLS: Multi-agent learning system with reward factor matrix and multi-critic framework for dynamic portfolio optimization},
  author = {Ruoyu Sun and Angelos Stefanidis and Zhengyong Jiang and Jionglong Su},
  journal= {arXiv preprint arXiv:2504.11874},
  year   = {2025}
}