SQT —— 标准 $Q$-target
机器学习
2024-06-04 v3 人工智能
摘要
标准 -target 是一种保守的、actor-critic、集成式、基于 -learning 的算法,它基于单个关键 公式:-网络标准差,这是一种“不确定性惩罚”,并作为过估计偏差问题的极简解决方案。我们在 TD3/TD7 代码之上实现了 SQT,并在七个流行的 MuJoCo 和 Bullet 任务上针对最先进(SOTA)的 actor-critic 算法 DDPG、TD3 和 TD7 对其进行了测试。我们的结果表明,作为 RL 中过估计偏差的保守解决方案,SQT 的 -target 公式优于 TD3 的 -target 公式,同时在所有任务上 SQT 比 DDPG、TD3 和 TD7 展现出大幅度的明显性能优势。
引用
@article{arxiv.2402.05950,
title = {SQT -- std $Q$-target},
author = {Nitsan Soffair and Dotan Di-Castro and Orly Avner and Shie Mannor},
journal= {arXiv preprint arXiv:2402.05950},
year = {2024}
}