面向搜索学习的自适应后见经验回放
机器学习
2025-11-06 v1 人工智能
摘要
类似AlphaZero的蒙特卡洛树搜索系统最初是为双人游戏引入的,它利用神经网络引导动态平衡探索与利用。这种组合使其也适用于经典搜索问题。然而,使用模拟结果训练网络的原始方法在稀疏奖励设置中受到限制,尤其是在早期阶段,此时网络尚无法提供引导。后见经验回放通过将搜索树中不成功的轨迹重新标记为监督学习信号来解决此问题。我们引入了自适应后见经验回放(\ours{}),这是一个将HER与AlphaZero集成的灵活框架,允许轻松调整HER的属性,例如重新标记的目标、策略目标和轨迹选择。我们的实验(包括方程发现)表明,修改HER的可能性是有益的,并且超越了纯监督学习或强化学习的性能。
引用
@article{arxiv.2511.03405,
title = {Adaptable Hindsight Experience Replay for Search-Based Learning},
author = {Alexandros Vazaios and Jannis Brugger and Cedric Derstroff and Kristian Kersting and Mira Mezini},
journal= {arXiv preprint arXiv:2511.03405},
year = {2025}
}
备注
8 pages, 2 figures, Presented at the 9th International Workshop on Interactive Adaptive Learning