GraphAllocBench:用于偏好条件多目标策略学习的灵活基准
机器学习
2026-02-04 v3
摘要
偏好条件策略学习 (PCPL) 在多目标强化学习 (MORL) 中旨在通过依据用户指定的目标偏好来条件化策略,从而逼近多样化的帕累托最优解。这使单个模型能够在运行时灵活适应任意权衡,生成位于帕累托前沿上的策略。然而,现有的 PCPL 基准大多局限于玩具任务和固定环境,限制了其真实性和可扩展性。为此,我们引入 GraphAllocBench,一个建立在受城市管理启发的新型图基资源分配沙盒环境(称为 CityPlannerEnv)之上的灵活基准。GraphAllocBench 提供丰富的题目集合,包含多样化的目标函数、变化的偏好条件和高维可扩展性。我们还提出两种新评估指标——非支配解比例 (PNDS) 和排序得分 (OS)——直接捕捉偏好一致性,补充广泛使用的超体积指标。通过对多层感知器 (MLP) 和图感知模型进行实验,我们表明 GraphAllocBench 揭示了现有 MORL 方法的局限性,为在复杂高维组合配置任务中使用图神经网络 (GNN) 铺平了道路。除了预定义的题目集合之外,GraphAllocBench 使用户能够灵活变更目标、偏好和配置规则,成为推进 PCPL 的通用且可扩展的基准。代码:https://github.com/jzh001/GraphAllocBench
引用
@article{arxiv.2601.20753,
title = {GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning},
author = {Zhiheng Jiang and Yunzhe Wang and Ryan Marr and Ellen Novoseller and Benjamin T. Files and Volkan Ustun},
journal= {arXiv preprint arXiv:2601.20753},
year = {2026}
}