中文

机器人看,机器人做:面向噪声金融环境的模仿奖励

机器学习 2024-11-14 v1 机器人学 交易与市场微观结构

摘要

金融资产交易中决策的序贯性质自然契合强化学习框架,使得强化学习成为该领域的常用方法。然而,金融市场中的低信噪比导致对环境组件(包括奖励函数)的估计存在噪声,从而阻碍了强化学习智能体进行有效的策略学习。鉴于奖励函数设计在强化学习问题中的关键重要性,本文通过利用模仿学习(其中趋势标记算法充当专家)引入了一种新颖且更鲁棒的奖励函数。我们将模仿(专家)反馈与强化(智能体)反馈集成到无模型强化学习算法中,有效地将模仿学习问题嵌入强化学习范式,以处理奖励信号的随机性。实验结果表明,与传统基准和仅使用强化反馈训练的强化学习智能体相比,这种新方法改善了财务绩效指标。

关键词

引用

@article{arxiv.2411.08637,
  title  = {Robot See, Robot Do: Imitation Reward for Noisy Financial Environments},
  author = {Sven Goluža and Tomislav Kovačević and Stjepan Begušić and Zvonko Kostanjčar},
  journal= {arXiv preprint arXiv:2411.08637},
  year   = {2024}
}