用于深度强化学习的整合自适应T-soft更新
机器学习
2024-09-16 v1 机器人学
摘要
对深度强化学习(DRL)的需求逐渐增长,以使机器人能够执行复杂任务,而DRL已知是不稳定的。作为一种稳定其学习的技术,缓慢且渐近匹配主网络的目标网络被广泛用于生成稳定的伪监督信号。近来,T-soft更新被提出作为目标网络的抗噪声更新规则,并有助于提升DRL性能。然而,T-soft更新的噪声鲁棒性由一个超参数指定,该参数需针对每个任务调优,并且会因简化实现而退化。本研究利用近期开发的AdaTerm中的更新规则,发展了自适应T-soft(AT-soft)更新。此外,针对目标网络不渐近匹配主网络的担忧,通过一种新的整合将主网络拉回目标网络得以缓解。这一所谓的整合AT-soft(CAT-soft)更新通过数值模拟得到验证。
引用
@article{arxiv.2202.12504,
title = {Consolidated Adaptive T-soft Update for Deep Reinforcement Learning},
author = {Taisuke Kobayashi},
journal= {arXiv preprint arXiv:2202.12504},
year = {2024}
}
备注
6 pages, 3 figures