面向自适应实时搜索的学习
人工智能
2007-05-23 v1 机器学习
摘要
实时启发式搜索是智能自主智能体中行动与学习的一种流行模型。学习型实时搜索智能体通过获取和细化引导其行动应用的值函数,随时间提高其性能。由于计算完美的值函数通常是不可行的,因此转而获取启发式近似。实时搜索(及强化学习)中的大多数研究假设使用简单的值函数贪婪策略来选择行动。这与实际应用形成对比,在实际中,高性能通常通过非平凡深度的前瞻搜索来交替进行规划与行动而实现。在本文中,我们朝着弥合这一差距迈出了一步,并提出了一种新算法,该算法 (i) 学习专门用于基于前瞻策略的启发式函数,(ii) 在每个状态下自适应地选择前瞻深度,(iii) 让用户控制探索与利用之间的权衡。我们在滑块拼图测试平台中对该算法进行了广泛评估,将其与经典的 LRTA* 以及较新的加权 LRTA*、有界 LRTA* 和 FALCONS 进行了比较。观察到收敛速度提高了 5 到 30 倍。
引用
@article{arxiv.cs/0407016,
title = {Learning for Adaptive Real-time Search},
author = {Vadim Bulitko},
journal= {arXiv preprint arXiv:cs/0407016},
year = {2007}
}