中文

ACE:具有因果感知熵正则化的离策 Actor-Critic

机器学习 2024-11-05 v5 人工智能

摘要

先前的无模型强化学习算法忽略了策略学习过程中不同原始行为的重要性差异。利用这一见解,我们探索了不同动作维度与奖励之间的因果关系,以评估训练期间各种原始行为的重要性。我们引入了一项因果感知熵项,能够有效识别并优先处理具有高潜在影响的动作,以实现高效探索。此外,为防止过度关注特定原始行为,我们分析了梯度休眠现象,并引入了一种休眠引导的重置机制,以进一步增强我们方法的有效性。我们提出的算法 ACE(具有因果感知熵正则化的离策 Actor-Critic)在跨越 7 个领域的 29 个多样化连续控制任务中,相较于无模型强化学习基线展现出显著的性能优势,突显了我们方法的有效性、通用性及高效的样本效率。基准测试结果和视频可在 https://ace-rl.github.io/ 获取。

关键词

引用

@article{arxiv.2402.14528,
  title  = {ACE : Off-Policy Actor-Critic with Causality-Aware Entropy Regularization},
  author = {Tianying Ji and Yongyuan Liang and Yan Zeng and Yu Luo and Guowei Xu and Jiawei Guo and Ruijie Zheng and Furong Huang and Fuchun Sun and Huazhe Xu},
  journal= {arXiv preprint arXiv:2402.14528},
  year   = {2024}
}

备注

Accepted by ICML 2024 as oral paper