中文

accommodating 挑剔客户:多目标强化学习的后悔界与探索复杂度

机器学习 2021-10-29 v3 机器学习

摘要

本文考虑以偏好平衡多目标的多目标强化学习。实践中,偏好常以对抗方式给出,例如在许多应用中客户可能很挑剔。我们将此问题形式化为马尔可夫决策过程上的 episodic 学习问题,其中转移未知且奖励函数为偏好向量与预先指定的多目标奖励函数的内积。我们考虑两种设定。在在线设定中,智能体每轮收到一个(对抗的)偏好并提出策略与环境交互。我们提供一种基于模型的算法,达到近乎极小极大最优的后悔界 O~(min{d,S}H2SAK)\widetilde{\mathcal{O}}\bigl(\sqrt{\min\{d,S\}\cdot H^2 SAK}\bigr),其中 dd 为目标数,SS 为状态数,AA 为动作数,HH 为 horizon 长度,KK 为轮数。此外,我们考虑无偏好探索,即智能体先在不指定任何偏好的情况下与环境交互,之后能够以 ϵ\epsilon 误差容纳任意偏好向量。我们提出的算法可证高效,具有近乎最优的轨迹复杂度 O~(min{d,S}H3SA/ϵ2)\widetilde{\mathcal{O}}\bigl({\min\{d,S\}\cdot H^3 SA}/{\epsilon^2}\bigr)。该结果部分解决了 \citet{jin2020reward} 提出的一个开放问题。

关键词

引用

@article{arxiv.2011.13034,
  title  = {Accommodating Picky Customers: Regret Bound and Exploration Complexity for Multi-Objective Reinforcement Learning},
  author = {Jingfeng Wu and Vladimir Braverman and Lin F. Yang},
  journal= {arXiv preprint arXiv:2011.13034},
  year   = {2021}
}

备注

NeurIPS 2021 Camera Ready Version