中文

基于生成流模型期望标量化回报的多目标协调图

人工智能 2022-07-04 v1 机器学习

摘要

许多现实世界问题包含多个目标与多个智能体,目标之间存在权衡。解决此类问题的关键在于利用智能体之间存在的稀疏依赖结构。例如,在风电场控制中,存在最大化功率与最小化系统部件应力之间的权衡。涡轮机之间的依赖因尾流效应而产生。我们将智能体间的此类稀疏依赖建模为多目标协调图(MO-CoG)。在多目标强化学习中,通常使用效用函数对用户关于各目标的偏好建模,而该偏好可能事先未知。在此类设定中,必须计算一组最优策略。哪些策略最优取决于所采用的最优性准则。若用户的效用函数源自策略的多次执行,则必须优化标量化期望回报(SER)。若用户的效用源自策略的单一执行,则必须优化期望标量化回报(ESR)准则。例如,风电场受制于必须始终遵守的约束与法规,因此必须优化ESR准则。对于MO-CoG,最先进算法仅能计算SER准则下的一组最优策略,使ESR准则研究不足。为在ESR准则下计算一组最优策略(亦称ESR集),必须维护关于回报的分布。因此,为在MO-CoG的ESR准则下计算一组最优策略,我们提出一种新颖的分布型多目标变量消去(DMOVE)算法。我们在真实的风电场仿真中评估DMOVE。鉴于真实风电场设定中回报是连续的,我们利用称为real-NVP的模型来学习连续回报分布以计算ESR集。

关键词

引用

@article{arxiv.2207.00368,
  title  = {Multi-Objective Coordination Graphs for the Expected Scalarised Returns with Generative Flow Models},
  author = {Conor F. Hayes and Timothy Verstraeten and Diederik M. Roijers and Enda Howley and Patrick Mannion},
  journal= {arXiv preprint arXiv:2207.00368},
  year   = {2022}
}