中文

Q-Learning 中强化示教所需的样本复杂度

机器学习 2021-03-09 v2 人工智能 机器学习

摘要

我们研究了示教的样本复杂度,文献中称为“示教维度”(TDim),针对强化示教范式,其中教师通过奖励引导学生。这不同于受机器人应用驱动的示范示教范式,后者中教师通过提供状态/动作轨迹的演示来进行教学。强化示教范式适用于更广泛的现实场景,其中演示不便提供,但此前尚未被系统研究。在本文中,我们聚焦于一类特定的强化学习算法——Q-learning,并刻画了在不同对环境具有不同控制力的教师下的 TDim,给出了相应的最优示教算法。我们的 TDim 结果给出了强化学习所需的最小样本数,并讨论了它们与标准 PAC 风格 RL 样本复杂度及示范示教样本复杂度结果之间的联系。我们的示教算法有望在有帮助的教师可用的应用中加速 RL 智能体的学习。

关键词

引用

@article{arxiv.2006.09324,
  title  = {The Sample Complexity of Teaching-by-Reinforcement on Q-Learning},
  author = {Xuezhou Zhang and Shubham Kumar Bharti and Yuzhe Ma and Adish Singla and Xiaojin Zhu},
  journal= {arXiv preprint arXiv:2006.09324},
  year   = {2021}
}