[复刻] FairDICE:多目标离线强化学习中的公平权衡
机器学习
2026-05-22 v2
摘要
离线强化学习(Offline Reinforcement Learning, RL)是一种仅从演示中学习策略的强化学习方法。在离线 RL 中,某些环境需要在多个目标之间进行平衡,但现有的多目标离线 RL 算法无法提供有效的公平妥协方案。FairDICE(见 arXiv:2506.08062v2)通过改造 OptiDICE(一种离线 RL 算法)来自动学习多个目标的权重,从而例如激励目标之间的公平性。由于这一贡献具有重要价值,本复刻研究考察了 FairDICE 主张的可复现性。我们发现许多理论主张成立,但代码中存在错误导致 FairDICE 在连续环境中退化为标准行为克隆,且许多重要超参数最初未得到充分 specification。经修正后,我们在扩展原论文的实验中表明,FairDICE 能够扩展到复杂环境和高维奖励,尽管其对(在线)超参数调优较为依赖。我们得出结论,FairDICE 是一种理论上有趣的方法,但实验论证需要 significant revision。
引用
@article{arxiv.2603.03454,
title = {[Re] FairDICE: A Fair Tradeoff in Multi-objective Offline RL},
author = {Peter Adema and Karim Galliamov and Aleksey Evstratovskiy and Ross Geurts},
journal= {arXiv preprint arXiv:2603.03454},
year = {2026}
}
备注
12 pages, 8 figures in main text. Code at https://github.com/p-adema/re-fairdice. Reviewed at https://openreview.net/forum?id=Tr6MBt0hAj