基于自动奖励塑形的易混淆连续控制
机器学习
2026-02-12 v1 人工智能
机器人学
摘要
奖励塑形已被广泛应用于加速强化学习(RL)代理的训练。然而,对于复杂的连续控制问题,设计有效奖励塑形函数的原则方法仍大多未被探讨。本文提出了从离线数据集中自动学习连续控制问题的奖励塑形函数的 方法。该方法考虑到可能受到不可观测混合变量污染。具体而言,我们的方法基于最近提出的因果 Bellman 方程来学习 optimal state 值的紧上界,然后用作潜在基于潜在的奖励塑形(Potential-Based Reward Shaping,PBRS)框架中的势。我们提出的奖励塑形算法在多个常用连续控制基准上使用 Soft-Actor-Critic(SAC)进行测试,并在不可观测混合变量下具有强大的性能保证。更广泛地说,我们的工作标志着从因果视角出发实现对易混淆连续控制的坚实的第一步。用于训练奖励塑形函数的代码可在 https://github.com/mateojuliani/confounding_robust_cont_control 上获得。
引用
@article{arxiv.2602.10305,
title = {Confounding Robust Continuous Control via Automatic Reward Shaping},
author = {Mateo Juliani and Mingxuan Li and Elias Bareinboim},
journal= {arXiv preprint arXiv:2602.10305},
year = {2026}
}
备注
Mateo Juliani and Mingxuan Li contributed equally to this work; accepted in AAMAS 2026