PRISM:面向 MORL 的并行奖励集成与对称性
机器学习
2026-02-23 v1 人工智能
机器学习
摘要
本 work 研究了异构多目标强化学习 (MORL),其中目标在时间频率上存在显著差异。这种异构性允许稠密目标主导学习,而稀疏长期奖励则获得较弱的信用分配,导致样本效率较差。我们提出一种并行奖励集成与对称性 (PRISM) 算法,通过在奖励通道对齐中引入对称性作为归纳偏置。PRISM 引入 ReSymNet,一种以理论为导驱动的模型,用于解决目标之间的时间频率不匹配,使用残差块学习 scaled opportunity value,以加速探索同时保持最优策略。我们还提出 SymReg,一种反射等变正则化器,用于强制代理镜像并将策略搜索限制在反射等变子空间中。该限制可证明地降低了假设复杂度并提高了泛化能力。在 MuJoCo基准测试中,PRISM consistently 超过了稀疏奖励基线和 oracle(完全稠密奖励训练的模型),提升了 Pareto 覆盖率和分布平衡性:它相对于基线实现了超过 100% 的 hypervolume 提升,相对于 oracle 实现了最高 32% 的提升。代码地址为 \href{https://github.com/EVIEHub/PRISM}{https://github.com/EVIEHub/PRISM}。
引用
@article{arxiv.2602.18277,
title = {PRISM: Parallel Reward Integration with Symmetry for MORL},
author = {Finn van der Knaap and Kejiang Qian and Zheng Xu and Fengxiang He},
journal= {arXiv preprint arXiv:2602.18277},
year = {2026}
}