基于 Rényi 散度的风险敏感控制作为推理
机器学习
2024-11-05 v1 系统与控制
系统与控制
最优化与控制
机器学习
摘要
本文提出了基于 Rényi 散度变分推断的风险敏感控制作为推理(RCaI),扩展了 CaI。RCaI 被证明等价于对数概率正则化的风险敏感控制,这是最大熵(MaxEnt)控制的扩展。我们还证明了风险敏感最优策略可以通过求解软 Bellman 方程获得,揭示了 RCaI、MaxEnt 控制、CaI 的最优后验以及线性可解控制之间的若干等价关系。此外,基于 RCaI,我们推导了风险敏感强化学习方法:策略梯度和软演员-评论家(soft actor-critic)。当风险敏感参数消失时,我们恢复了风险中性的 CaI 和 RL,这意味着 RCaI 是一个统一的框架。此外,我们使用 Rényi 熵正则化给出了 MaxEnt 控制的另一种风险敏感推广。我们证明在这两种扩展中,最优策略具有相同的结构,尽管推导过程截然不同。
引用
@article{arxiv.2411.01827,
title = {Risk-sensitive control as inference with R\'enyi divergence},
author = {Kaito Ito and Kenji Kashima},
journal= {arXiv preprint arXiv:2411.01827},
year = {2024}
}
备注
Accepted at NeurIPS 2024