中文

基于 Itakura-Saito 损失的风险厌恶强化学习

机器学习 2025-05-27 v2

摘要

风险厌恶强化学习在诸多高风险领域具有应用前景。不同于经典强化学习旨在最大化期望回报,风险厌恶智能体选择最小化风险的政策,偶尔牺牲期望价值。这些偏好可以通过效用理论来表述。我们聚焦于指数效用函数的特定情况,其中可以推导出Bellman方程,并通过少量修改使用各种强化学习算法。为此,我们向广泛的机器学习社区介绍了一个基于Itakura-Saito 散度开发的损失函数,用于学习状态价值和动作价值函数。我们在理论和实证层面评估了Itakura-Saito 损失函数与已建立方法的比较。在实验部分,我们探索了多个场景,其中一些场景具有已知解析解,表明所考虑的损失函数优于其他方法。

关键词

引用

@article{arxiv.2505.16925,
  title  = {Risk-Averse Reinforcement Learning with Itakura-Saito Loss},
  author = {Igor Udovichenko and Olivier Croissant and Anita Toleutaeva and Evgeny Burnaev and Alexander Korotin},
  journal= {arXiv preprint arXiv:2505.16925},
  year   = {2025}
}