后见偏好重放改进偏好条件多目标强化学习
机器学习
2026-01-21 v1 人工智能
摘要
多目标强化学习(MORL)使智能体能够在尊重用户偏好的同时优化向量值奖励。CAPQL 是一种偏好条件演员-评论家方法,通过对权重向量 w 进行条件化来实现这一点,但将数据使用限制在其收集时所依据的特定偏好上,导致来自其他偏好的离策略数据未被使用。我们引入了后见偏好重放(HPR),这是一种简单且通用的重放增强策略,用替代偏好追溯性地重新标记存储的转换。这在偏好单纯形上密集化了监督,而无需改变 CAPQL 的架构或损失函数。在六个 MO-Gymnasium 机器人运动任务上,使用固定 300000 步预算,采用期望效用(EUM)、超体积(HV)和稀疏度进行评估,HPR-CAPQL 在六个环境中的五个中提升了 HV,在六个环境中的四个中提升了 EUM。例如,在 mo-humanoid-v5 上,EUM 从 上升至 ,HV 从 0.52M 提升至 9.63M,并具有强有力的统计学支持。mo-halfcheetah-v5 仍是一个具有挑战性的例外,CAPQL 在可比的 EUM 下获得了更高的 HV。我们报告了所有任务的最终总结和帕累托前沿可视化。
引用
@article{arxiv.2601.11604,
title = {Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning},
author = {Jonaid Shianifar and Michael Schukat and Karl Mason},
journal= {arXiv preprint arXiv:2601.11604},
year = {2026}
}