受约束多目标强化学习的离线适应框架
机器学习
2024-09-17 v1 人工智能
摘要
近年来,多目标强化学习(RL)研究取得了显著进展,旨在通过纳入每个目标的偏好来平衡多个目标。在大多数现有研究中,必须在部署时提供特定的偏好才能明确表示所需的策略。然而,设计这些偏好高度依赖人类先验知识,这些知识通常通过观察高性能演示中预期行为来获取。本文提出了一个简单而有效的多目标 RL 的离线适应框架,不假设手工制定目标偏好,而仅需给定几个演示以隐式指示预期策略的偏好。此外,我们演示了该框架可自然扩展到满足安全关键目标约束,即使安全阈值未知亦可通过利用安全演示实现。在离线多目标和安全任务上的实验结果表明,该框架能够推断出符合真实偏好且满足所提供演示所暗示约束的策略。
引用
@article{arxiv.2409.09958,
title = {An Offline Adaptation Framework for Constrained Multi-Objective Reinforcement Learning},
author = {Qian Lin and Zongkai Liu and Danying Mo and Chao Yu},
journal= {arXiv preprint arXiv:2409.09958},
year = {2024}
}