中文

一种具有收敛性分析的量纲无关多目标强化学习

机器学习 2023-02-28 v4

摘要

许多序贯决策问题需要优化可能相互冲突的不同目标。处理多任务问题的常规方法是基于不同目标的线性组合建立标量目标函数。然而,对于具有不同尺度的冲突目标的情况,该方法需要试错法以适当找到组合的正确权重。因此,在大多数情况下,这种方法无法保证最优帕累托解。在本文中,我们基于优势 actor-critic (A2C) 算法开发了一种单智能体量纲无关多目标强化学习。随后对所设计的多目标算法进行收敛性分析,提供均值收敛保证。我们随后在一个多任务问题上进行实验以评估所提算法的性能。仿真结果显示所开发的multi-objective A2C方法相对于单目标算法具有优越性。

关键词

引用

@article{arxiv.2302.04179,
  title  = {A Scale-Independent Multi-Objective Reinforcement Learning with Convergence Analysis},
  author = {Mohsen Amidzadeh},
  journal= {arXiv preprint arXiv:2302.04179},
  year   = {2023}
}