FairDICE:面向离线多目标强化学习的公平性驱动方法
机器学习
2025-11-19 v2 人工智能
摘要
多目标强化学习(MORL)旨在存在相互冲突目标的环境下优化策略, 其中常用的线性标量化方法将向量型回报转化为标量信号.虽然对某些偏好有效, 但此方法无法捕捉诸如诺氏社会福利或最大最小公平性等公平性导向目标, 这类目标需要非线性且非可加的权衡.虽然已提出若干在线算法针对特定公平目标, 但针对离线场景下(必须基于固定数据集学习)的非线性福利目标统一方法仍未探索.本文提出FairDICE, 首个能够直接优化非线性福利目标的离线MORL框架. FairDICE利用分布纠正估计, 在福利最大化和分布正则化之间进行联合考虑, 实现稳定且样本高效的学习, 无需显式偏好权重或穷尽搜索权重.在多个离线基准测试中, FairDICE显示出强大的公平性感知性能, 优于现有基线方法.
引用
@article{arxiv.2506.08062,
title = {FairDICE: Fairness-Driven Offline Multi-Objective Reinforcement Learning},
author = {Woosung Kim and Jinho Lee and Jongmin Lee and Byung-Jun Lee},
journal= {arXiv preprint arXiv:2506.08062},
year = {2025}
}
备注
Multi-objective Reinforcement Learning