中文

价值感知特征选项的研究

机器学习 2025-07-15 v1 机器学习

摘要

选项(Options)通过对时间和层次结构施加归纳偏置,为强化学习(RL)提供了强大的框架。虽然在顺序决策中效果良好,但它们往往是手工设计而非学习得出。在发现选项的方法中,特征选项在探索方面表现突出,但在信用分配中的作用仍未得到充分探索。本文我们研究特征选项是否能够加速信用分配在 model-free RL 中进行评估,在表格和像素基础的网格世界中进行。我们发现,预指定的特征选项不仅有助于探索,也有助于信用分配,而在线发现则可能过度偏向智能体的经验,从而阻碍学习。在深度 RL 的上下文中,我们还提出了一种在非线性函数逼近下学习选项价值的 метод,突显了终止条件对性能的影响。我们的发现揭示了使用特征选项(以及更广泛的选项)同时支持信用分配和探索在强化学习中的潜力与复杂性。

关键词

引用

@article{arxiv.2507.09127,
  title  = {A Study of Value-Aware Eigenoptions},
  author = {Harshil Kotamreddy and Marlos C. Machado},
  journal= {arXiv preprint arXiv:2507.09127},
  year   = {2025}
}

备注

Presented at the RLC Workshop on Inductive Biases in Reinforcement Learning 2025