策略正则化的离线多目标强化学习
机器学习
2024-01-05 v1 人工智能
摘要
本文旨在仅利用离线轨迹数据来训练多目标强化学习策略。为实现上述目标,我们将单目标离线强化学习问题中广泛采用的离线策略正则化方法扩展至多目标设定。然而,此类方法在离线多目标强化学习设定下面临一项新挑战,即偏好不一致示范问题。针对该问题,我们提出两种解决方案:1)通过近似行为偏好来过滤偏好不一致的示范;2)采用具有高策略表达能力的正则化技术。此外,我们将偏好条件的标量化更新方法整合至策略正则化离线强化学习中,从而利用单一策略网络同时学习一组策略,进而降低为各种偏好训练大量独立策略所带来的计算开销。最后,我们引入正则化权重自适应机制,以在部署阶段为任意目标偏好动态确定合适的正则化权重。在多种多目标数据集上的实验结果证明了我们该方法解决离线多目标强化学习问题的能力。
引用
@article{arxiv.2401.02244,
title = {Policy-regularized Offline Multi-objective Reinforcement Learning},
author = {Qian Lin and Chao Yu and Zongkai Liu and Zifan Wu},
journal= {arXiv preprint arXiv:2401.02244},
year = {2024}
}