面向约束多目标强化学习的冲突规避梯度聚合
机器学习
2024-06-03 v2
摘要
在许多现实世界应用中,强化学习 (RL) 智能体应考虑多个目标并遵守安全准则。为解决这些考量,我们提出了一种名为约束多目标梯度聚合器 (CoMOGA) 的约束多目标 RL 算法。在多目标优化领域,管理多个目标梯度间的冲突对于防止策略收敛至局部最优至关重要。同时,高效处理安全约束对于稳定训练和满足约束也必不可少。我们通过将多目标最大化视为一个约束优化问题 (COP) 来直接应对这些挑战,其中定义的约束旨在改善原始目标。现有的安全约束随后被整合到该 COP 中,并利用线性近似更新策略,从而确保避免梯度冲突。尽管 CoMOGA 结构简单,但它保证了在表格设置下的最优收敛。通过各种实验,我们确认了防止梯度冲突的关键性,且所提出的方法在所有任务中均实现了约束满足。
引用
@article{arxiv.2403.00282,
title = {Conflict-Averse Gradient Aggregation for Constrained Multi-Objective Reinforcement Learning},
author = {Dohyeong Kim and Mineui Hong and Jeongho Park and Songhwai Oh},
journal= {arXiv preprint arXiv:2403.00282},
year = {2024}
}
备注
25 pages