中文

基于分解的多目标强化学习:一种分类体系与框架

机器学习 2024-02-06 v2

摘要

多目标强化学习(MORL)扩展了传统 RL,旨在寻求在冲突目标间做出不同折中的策略。近期对 MORL 的兴趣激增导致了多样化的研究与求解方法,常借鉴基于分解的多目标优化(MOO/D)的现有知识。然而,现有文献缺乏基于 RL 与 MOO/D 的清晰分类。因此,由于缺乏标准化分类体系,MORL 研究者在试图将贡献归入更广阔背景时面临困难。为解决此问题,本文引入基于分解的多目标强化学习(MORL/D),一种桥接 RL 与 MOO 文献的新方法。我们提出了一个用于 MORL/D 的综合分类体系,为归类现有及潜在的 MORL 工作提供结构化基础。随后利用所引入的分类体系审视 MORL 研究,通过明确定义的分类增强清晰性与简洁性。此外,引入一个源自该分类体系的灵活框架。该框架容纳使用 RL 与 MOO/D 工具的多种实例化。其通用性通过在不同配置下实现并在对比性基准问题上评估得以展示。结果表明,在所研究问题上,MORL/D 实例化取得了与当前 SOTA 方法相当的性能。通过提出分类体系与框架,本文为 MORL 提供了综合视角与统一词汇。这不仅有助于识别算法贡献,也为 MORL 的新研究途径奠定基础。

关键词

引用

@article{arxiv.2311.12495,
  title  = {Multi-Objective Reinforcement Learning Based on Decomposition: A Taxonomy and Framework},
  author = {Florian Felten and El-Ghazali Talbi and Grégoire Danoy},
  journal= {arXiv preprint arXiv:2311.12495},
  year   = {2024}
}

备注

Accepted at JAIR