中文

增强状态下的多目标强化学习需要部署后继续获取奖励

机器学习 2026-04-20 v1

摘要

本研究笔记识别了一个此前被忽视的区别,即多目标强化学习(MORL)与更常规的单目标强化学习(RL)之间的区别。此前有人指出,具有非线性效用函数的 MORL 智能体的最优策略需要同时依赖当前环境状态和先前累积奖励的某种度量。这通常通过将观察到的环境状态与之前折扣奖励之和拼接以创建增强状态来实现。尽管增强状态在 MORL 文献中被广泛使用,但其的一个含义尚未被报告——即即使不需要进一步学习,也需要在部署后继续获取奖励信号(或其代理)。本文解释了这一原因,并考虑了这一要求的实际后果。

关键词

引用

@article{arxiv.2604.15757,
  title  = {Multi-objective Reinforcement Learning With Augmented States Requires Rewards After Deployment},
  author = {Peter Vamplew and Cameron Foale},
  journal= {arXiv preprint arXiv:2604.15757},
  year   = {2026}
}