多目标强化学习中的稠密且多样的目标覆盖
机器学习
2026-03-31 v2 人工智能
摘要
强化学习算法主要致力于学习最大化预期回报的策略。因此,所学策略可能利用一个或多个奖励来源。然而,在许多自然情境下,期望学习一种在奖励状态上产生分散边缘状态分布的策略,同时最大化通常与到达目标状态相关联的预期回报。这一方面仍相对未被充分探索。基于熵正则化和内在奖励的现有技术使用随机性来鼓励探索以寻找最优策略,但这可能并不一定导致对奖励状态的分散边缘状态分布。其他基于匹配目标分布的 RL 算法假设该分布已知。这在大规模系统中可能不可行,因为状态的枚举不可行,只有到达该状态后才能确定其为目标状态。我们将最大化预期回报的同时均匀访问目标状态的问题形式化为多目标强化学习 (Multi Goal RL),其中对状态空间进行 oracle 分类以确定目标状态。我们提出了一种新算法,该算法学习具有在目标状态集合上产生分散边缘状态分布的高回报策略混合物。该算法基于优化计算的自定义 RL 奖励,该奖励在每个迭代中基于当前策略混合物计算,用于一组抽样轨迹。后者通过离线 RL 算法用于更新策略混合物。我们为该算法提供了性能保证,证明了优化捕获预期回报以及目标状态边缘状态分布分散性的自然目标的高效收敛界限。我们在合成 MDP 和标准 RL 环境上进行实验,以评估该算法的有效性。
引用
@article{arxiv.2510.25311,
title = {Dense and Diverse Goal Coverage in Multi Goal Reinforcement Learning},
author = {Sagalpreet Singh and Rishi Saket and Aravindan Raghuveer},
journal= {arXiv preprint arXiv:2510.25311},
year = {2026}
}
备注
27 pages, 6 figures