冲突规避多目标强化学习的理论研究
机器学习
2024-12-24 v3
摘要
多任务强化学习 (MTRL) 在许多实际应用中展现出巨大的潜力。现有的 MTRL 方法通常致力于学习一个在给定任务间的偏好(或权重)下同时优化各个目标函数的策略。然而,这些方法常常存在“梯度冲突”问题,即梯度较大的任务主导更新方向,导致其他任务的性能下降。本文在两种子程序选项(称为 CA 和 FC)下,开发了一种新型的动态加权多任务演员-评论家算法 (MTAC)。MTAC-CA 旨在寻找一种冲突规避 (CA) 的更新方向,以最大化各任务中最小的价值提升;MTAC-FC 则目标是实现更快的收敛速度。我们为两种算法提供了全面的有限时长收敛分析。我们指出,MTAC-CA 能在 个样本内找到一个 -精确的帕累托稳态策略,同时确保一个小 -水平的 CA 距离(定义为到 CA 方向的距离),其中 为函数逼近误差。分析还表明,MTAC-FC 将样本复杂度提升至 ,但保持恒定水平的 CA 距离。我们的实验在 MT10 上表明,我们的方法在具有固定偏好的现有 MTRL 方法之上实现了 improved performance。
引用
@article{arxiv.2405.16077,
title = {Theoretical Study of Conflict-Avoidant Multi-Objective Reinforcement Learning},
author = {Yudan Wang and Peiyao Xiao and Hao Ban and Kaiyi Ji and Shaofeng Zou},
journal= {arXiv preprint arXiv:2405.16077},
year = {2024}
}
备注
Initial submission at the 41$^{st}$ International Conference on Machine Learning