基于 Itakura-Saito 损失的风险厌恶强化学习
机器学习
2025-05-27 v2
摘要
风险厌恶强化学习在诸多高风险领域具有应用前景。不同于经典强化学习旨在最大化期望回报,风险厌恶智能体选择最小化风险的政策,偶尔牺牲期望价值。这些偏好可以通过效用理论来表述。我们聚焦于指数效用函数的特定情况,其中可以推导出Bellman方程,并通过少量修改使用各种强化学习算法。为此,我们向广泛的机器学习社区介绍了一个基于Itakura-Saito 散度开发的损失函数,用于学习状态价值和动作价值函数。我们在理论和实证层面评估了Itakura-Saito 损失函数与已建立方法的比较。在实验部分,我们探索了多个场景,其中一些场景具有已知解析解,表明所考虑的损失函数优于其他方法。
引用
@article{arxiv.2505.16925,
title = {Risk-Averse Reinforcement Learning with Itakura-Saito Loss},
author = {Igor Udovichenko and Olivier Croissant and Anita Toleutaeva and Evgeny Burnaev and Alexander Korotin},
journal= {arXiv preprint arXiv:2505.16925},
year = {2025}
}