多目标强化学习的架构与损失函数探索
机器学习
2024-07-25 v1 人工智能
摘要
多目标强化学习(Multi-objective reinforcement learning,MORL)是解决实际 RL 问题中多重效用函数间权衡的关键技术。然而,由于使用深度学习函数逼近器,MORL 面临学习动力学不稳定的问题。目前大多数研究路径是通过探索不同的价值型损失函数来克服这一挑战。本文通过经验方法探索模型无关的策略学习损失函数及不同架构选择的影响。我们引入了两种方法:一种是扩展 MORL 的多目标近端策略优化(Multi-objective Proximal Policy Optimization,MOPPO),另一种是作为我们消除实验中的简单基线的多目标优势演员-评论家(Multi-objective Advantage Actor Critic,MOA2C)。我们的方法在实现上简洁,仅需对函数逼近器进行少量修改。我们在 MORL 深海宝藏、矿车和到达器等环境上进行了全面评估,表明 MOPPO 能有效捕获帕累托前沿。我们的大量消除实验和经验分析揭示了不同架构选择的影响,凸显了 MOPPO 在帕累托条件网络(PCN)和信封 Q 学习等流行 MORL 方法在超参数体积和预期效用等 MORL 指标方面的鲁棒性与灵活性。
引用
@article{arxiv.2407.16807,
title = {In Search for Architectures and Loss Functions in Multi-Objective Reinforcement Learning},
author = {Mikhail Terekhov and Caglar Gulcehre},
journal= {arXiv preprint arXiv:2407.16807},
year = {2024}
}
备注
20 pages, 10 figures, 3 tables