中文

关于具有每回合一次反馈的强化学习理论

机器学习 2022-08-23 v3 人工智能 机器学习

摘要

我们研究一种强化学习(RL)理论,其中学习器仅在一个回合结束时收到一次二进制反馈。尽管这是理论上的一个极端测试案例,但它相较于 RL 实践中要求学习器在每时间步收到反馈的传统要求,也可谓更代表真实世界应用。事实上,在诸如自动驾驶汽车与机器人等许多真实世界的强化学习应用中,更易评判学习器的完整轨迹为“好”或“坏”,却更难在每一步提供奖励信号。为表明在该更具挑战性的设定下学习是可能的,我们研究轨迹标签由未知参数模型生成的情形,并提供一种在统计与计算上均高效的算法,可实现次线性后悔。

关键词

引用

@article{arxiv.2105.14363,
  title  = {On the Theory of Reinforcement Learning with Once-per-Episode Feedback},
  author = {Niladri S. Chatterji and Aldo Pacchiano and Peter L. Bartlett and Michael I. Jordan},
  journal= {arXiv preprint arXiv:2105.14363},
  year   = {2022}
}

备注

Published at NeurIPS 2022