中文

具有非线性偏好的多目标强化学习:最大化期望标量化回报的可证明近似

机器学习 2025-02-19 v4 人工智能

摘要

我们研究对轨迹具有非线性偏好的多目标强化学习。即在多目标马尔可夫决策过程(MOMDP)中,最大化累积奖励上非线性函数的期望值(期望标量化回报或ESR)。我们导出非线性优化下显式考虑时间与当前累积奖励的Bellman最优性扩展形式。利用该表述,我们描述一种近似算法,在伪多项式时间内针对具常数个奖励的平滑标量化函数计算近似最优非平稳策略。我们解析证明该近似,并通过实验展示算法,表明我们的算法所算最优策略与替代基线间可能存在实质差距。

关键词

引用

@article{arxiv.2311.02544,
  title  = {Multi-objective Reinforcement Learning with Nonlinear Preferences: Provable Approximation for Maximizing Expected Scalarized Return},
  author = {Nianli Peng and Muhang Tian and Brandon Fain},
  journal= {arXiv preprint arXiv:2311.02544},
  year   = {2025}
}