中文

SQT —— 标准 $Q$-target

机器学习 2024-06-04 v3 人工智能

摘要

标准 QQ-target 是一种保守的、actor-critic、集成式、基于 QQ-learning 的算法,它基于单个关键 QQ 公式:QQ-网络标准差,这是一种“不确定性惩罚”,并作为过估计偏差问题的极简解决方案。我们在 TD3/TD7 代码之上实现了 SQT,并在七个流行的 MuJoCo 和 Bullet 任务上针对最先进(SOTA)的 actor-critic 算法 DDPG、TD3 和 TD7 对其进行了测试。我们的结果表明,作为 RL 中过估计偏差的保守解决方案,SQT 的 QQ-target 公式优于 TD3 的 QQ-target 公式,同时在所有任务上 SQT 比 DDPG、TD3 和 TD7 展现出大幅度的明显性能优势。

关键词

引用

@article{arxiv.2402.05950,
  title  = {SQT -- std $Q$-target},
  author = {Nitsan Soffair and Dotan Di-Castro and Orly Avner and Shie Mannor},
  journal= {arXiv preprint arXiv:2402.05950},
  year   = {2024}
}