DSAC:面向风险敏感强化学习的分布软演员-评论家
机器学习
2025-07-01 v3 人工智能
摘要
我们提出分布软演员-评论家(DSAC),一种分布强化学习(RL)算法,它结合了累积奖励的分布信息与来自软演员-评论家(SAC)算法的熵驱动探索的优势。DSAC 对动作与奖励中的随机性进行建模,在各种连续控制任务上超越基线性能。与仅最大化期望奖励的标准方法不同,我们提出了一个风险敏感学习的统一框架,该框架在优化风险相关目标的同时平衡熵以鼓励探索。大量实验证明了 DSAC 在提升风险中性与风险敏感控制任务中智能体性能方面的有效性。
引用
@article{arxiv.2004.14547,
title = {DSAC: Distributional Soft Actor-Critic for Risk-Sensitive Reinforcement Learning},
author = {Xiaoteng Ma and Junyao Chen and Li Xia and Jun Yang and Qianchuan Zhao and Zhengyuan Zhou},
journal= {arXiv preprint arXiv:2004.14547},
year = {2025}
}
备注
Accecpted by Journal of Artificial Intelligence Research