中文

DSAC:面向风险敏感强化学习的分布软演员-评论家

机器学习 2025-07-01 v3 人工智能

摘要

我们提出分布软演员-评论家(DSAC),一种分布强化学习(RL)算法,它结合了累积奖励的分布信息与来自软演员-评论家(SAC)算法的熵驱动探索的优势。DSAC 对动作与奖励中的随机性进行建模,在各种连续控制任务上超越基线性能。与仅最大化期望奖励的标准方法不同,我们提出了一个风险敏感学习的统一框架,该框架在优化风险相关目标的同时平衡熵以鼓励探索。大量实验证明了 DSAC 在提升风险中性与风险敏感控制任务中智能体性能方面的有效性。

关键词

引用

@article{arxiv.2004.14547,
  title  = {DSAC: Distributional Soft Actor-Critic for Risk-Sensitive Reinforcement Learning},
  author = {Xiaoteng Ma and Junyao Chen and Li Xia and Jun Yang and Qianchuan Zhao and Zhengyuan Zhou},
  journal= {arXiv preprint arXiv:2004.14547},
  year   = {2025}
}

备注

Accecpted by Journal of Artificial Intelligence Research