中文

作为知识蒸馏的目标条件 Q-Learning

机器学习 2023-03-09 v4

摘要

强化学习的许多应用可被形式化为目标条件环境,其中在每一回合中有一个“目标”影响该回合中获得的奖励但不影响动力学。人们已提出各种技术来改进目标条件环境中的性能,例如自动课程生成和目标重标。在本工作中,我们探索目标条件设定下的离策略强化学习与知识蒸馏之间的联系。具体而言:当前 Q 值函数与目标 Q 值估计都是目标的函数,我们希望训练 Q 值函数以对所有目标匹配其目标。因此我们应用基于梯度的注意力迁移(Zagoruyko 和 Komodakis 2017),一种知识蒸馏技术,于 Q 函数更新。我们经实验表明,当目标空间为高维时,这能改进目标条件离策略强化学习的性能。我们还展示该技术可被调整以允许多重同时稀疏目标情况下的高效学习,其中智能体可通过实现大量在测试时指定的目标中的任意一个来获得奖励。最后,为提供理论支持,我们给出若干类环境的例子,其中(在某些假设下)标准离策略算法如 DDPG 需要至少 O(d^2) 次回放缓冲转移来学习最优策略,而我们提出的技术仅需 O(d) 次转移,其中 d 是目标与状态空间的维数。代码见 https://github.com/alevine0/ReenGAGE。

关键词

引用

@article{arxiv.2208.13298,
  title  = {Goal-Conditioned Q-Learning as Knowledge Distillation},
  author = {Alexander Levine and Soheil Feizi},
  journal= {arXiv preprint arXiv:2208.13298},
  year   = {2023}
}

备注

AAAI 2023 Accepted paper