超越单步更新:基于有限视野搜索的强化学习 heuristics
人工智能
2025-11-14 v1
摘要
许多序列决策问题可形式化为最短路径问题,目标是从给定的起始状态到达目标状态。启发式搜索是解决此类问题的标准方法,依赖于用于估计从任意给定状态到目标代价的启发式函数。最近的做法利用强化学习来学习启发式函数,通过应用深度近似值迭代来实现。这些方法通常依赖单步 Bellman 更新,其中状态的启发式值基于其最佳邻居及相应边代价进行更新。本工作提出了一种通用方法,通过执行有限视野搜索来增强状态抽样和启发式更新,并根据到达搜索前沿的最短路径更新每个状态的启发式值,纳入边代价和前沿状态的启发式值。
关键词
引用
@article{arxiv.2511.10264,
title = {Beyond Single-Step Updates: Reinforcement Learning of Heuristics with Limited-Horizon Search},
author = {Gal Hadar and Forest Agostinelli and Shahaf S. Shperberg},
journal= {arXiv preprint arXiv:2511.10264},
year = {2025}
}