基于UCB驱动的多目标强化学习中的效用函数搜索
机器学习
2025-06-17 v3
摘要
在多目标强化学习(MORL)中,智能体需要优化在多个可能相互冲突的目标之间进行决策的行为。基于分解的MORL是一系列解决方案方法,采用多个效用函数将多目标问题分解为同时解决的多个单目标问题,以逼近策略的帕累托前沿。我们关注线性效用函数,由权重向量参数化。在本文中,我们引入一种基于上置置信界(UCB)的方法,有效搜索不同学习阶段最有希望的权重向量,以最大化所得帕累托前沿的超体积。该方法在Mujoco基准问题中表现出一致性和优异性能。代码已发布于:https://github.com/SYCAMORE-1/ucb-MOPPO
引用
@article{arxiv.2405.00410,
title = {UCB-driven Utility Function Search for Multi-objective Reinforcement Learning},
author = {Yucheng Shi and David Lynch and Alexandros Agapitos},
journal= {arXiv preprint arXiv:2405.00410},
year = {2025}
}