中文

不良习性:强化学习中的策略混淆与轨迹外泛化

机器学习 2024-06-25 v2

摘要

强化学习智能体倾向于养成仅在特定策略下有效的习惯。在智能体尝试不同动作的初始探索阶段之后,它们最终会收敛到某个特定策略。随着这一过程发生,状态-动作轨迹上的分布变窄,导致智能体反复经历相同的转移。这种重复性暴露培养了某些观测与奖励之间的虚假关联。智能体随后可能注意到这些关联,并养成针对其策略所规定的特定轨迹集合的简化习惯。问题在于,当环境变化迫使智能体偏离典型轨迹时,这些习惯可能产生错误结果。本文对该现象(称为策略混淆)给出了数学刻画,并通过一系列示例说明了其发生的条件。

关键词

引用

@article{arxiv.2306.02419,
  title  = {Bad Habits: Policy Confounding and Out-of-Trajectory Generalization in RL},
  author = {Miguel Suau and Matthijs T. J. Spaan and Frans A. Oliehoek},
  journal= {arXiv preprint arXiv:2306.02419},
  year   = {2024}
}