通过稀疏正则化进行带稀疏执行动作的强化学习
机器学习
2024-07-23 v4 人工智能
摘要
强化学习(RL)已在具身控制、自动驾驶和金融交易等决策任务中展现出令人印象深刻的性能。在许多决策任务中,智能体常遇到在有限预算下执行动作的问题。然而,经典 RL 方法通常忽视此类稀疏执行动作带来的挑战。它们假设所有动作均可无限次执行,无论是在问题表述还是有效算法开发中。为解决 RL 中动作执行受限的问题,本文首先将问题形式化为稀疏动作马尔可夫决策过程(SA-MDP),其中动作空间中的特定动作只能执行有限次。然后,我们提出一种策略优化算法——动作稀疏正则化(ASRE),其以不同偏好自适应地处理每个动作。ASRE 通过两步操作:首先,ASRE 通过约束动作采样评估动作稀疏性;随后,ASRE 通过动作分布正则化将稀疏性评估纳入策略学习。我们提供了理论证明,验证了 ASRE 收敛到正则最优值函数。在已知稀疏执行动作的任务上,经典 RL 算法难以高效训练策略,而 ASRE 有效约束动作采样并优于基线。此外,我们表明 ASRE 通常可提升在 Atari 游戏中的性能,证明其广泛适用性。
引用
@article{arxiv.2105.08666,
title = {Reinforcement Learning With Sparse-Executing Actions via Sparsity Regularization},
author = {Jing-Cheng Pang and Tian Xu and Shengyi Jiang and Yu-Ren Liu and Yang Yu},
journal= {arXiv preprint arXiv:2105.08666},
year = {2024}
}