实现在线 TD-Replan(λ) 的真实在线 TD: 通过回放实现规划
机器学习
2025-02-03 v1
摘要
本文发展了一种新的规划方法,扩展了 true online TD 的能力,使其能够高效地按其出现的顺序在线回放其过去的经验,既可在每一步中回放,也可根据通常的 λ 参数进行稀疏回放。在我们称为 True Online TD-Replan(λ) 的新方法中,λ 参数在指定回放过程密度方面发挥了新的作用,除此之外还发挥了指定目标更新深度的通常角色。我们展示了对于受经验回放益处的问题,our new method 优于 true online TD(λ),尽管由于其回放功能而呈二次复杂度。此外,我们展示了我们的 метод 优于具有类似二次复杂度的其他方法,如 Dyna 规划和 TD(λ)-Replan算法。我们在两个基准环境中测试了我们的 方法:一个使用简单二进制特征的随机行走问题,一个使用简单 sEMG 特征和深层提取特征的肌电控制领域,以展示其能力。
引用
@article{arxiv.2501.19027,
title = {True Online TD-Replan(lambda) Achieving Planning through Replaying},
author = {Abdulrahman Altahhan},
journal= {arXiv preprint arXiv:2501.19027},
year = {2025}
}