中文

冲突规避多目标强化学习的理论研究

机器学习 2024-12-24 v3

摘要

多任务强化学习 (MTRL) 在许多实际应用中展现出巨大的潜力。现有的 MTRL 方法通常致力于学习一个在给定任务间的偏好(或权重)下同时优化各个目标函数的策略。然而,这些方法常常存在“梯度冲突”问题,即梯度较大的任务主导更新方向,导致其他任务的性能下降。本文在两种子程序选项(称为 CA 和 FC)下,开发了一种新型的动态加权多任务演员-评论家算法 (MTAC)。MTAC-CA 旨在寻找一种冲突规避 (CA) 的更新方向,以最大化各任务中最小的价值提升;MTAC-FC 则目标是实现更快的收敛速度。我们为两种算法提供了全面的有限时长收敛分析。我们指出,MTAC-CA 能在 O(ϵ5)\mathcal{O}({\epsilon^{-5}}) 个样本内找到一个 ϵ+ϵapp\epsilon+\epsilon_{\text{app}}-精确的帕累托稳态策略,同时确保一个小 ϵ+ϵapp\epsilon+\sqrt{\epsilon_{\text{app}}}-水平的 CA 距离(定义为到 CA 方向的距离),其中 ϵapp\epsilon_{\text{app}} 为函数逼近误差。分析还表明,MTAC-FC 将样本复杂度提升至 O(ϵ3)\mathcal{O}(\epsilon^{-3}),但保持恒定水平的 CA 距离。我们的实验在 MT10 上表明,我们的方法在具有固定偏好的现有 MTRL 方法之上实现了 improved performance。

关键词

引用

@article{arxiv.2405.16077,
  title  = {Theoretical Study of Conflict-Avoidant Multi-Objective Reinforcement Learning},
  author = {Yudan Wang and Peiyao Xiao and Hao Ban and Kaiyi Ji and Shaofeng Zou},
  journal= {arXiv preprint arXiv:2405.16077},
  year   = {2024}
}

备注

Initial submission at the 41$^{st}$ International Conference on Machine Learning