分块评论家:基于Transformer的软演员-评论家算法与N步回报
机器学习
2025-09-30 v3
摘要
我们提出了一种面向软演员-评论家(SAC)的序列条件评论家,使用轻量级Transformer建模轨迹上下文,并在聚合的N步目标上进行训练。与先前方法不同——(i) 孤立地评估状态-动作对,或 (ii) 依赖演员端动作分块来处理长时序——我们的方法通过以短轨迹段为条件并整合多步回报来增强评论家本身,且无需重要性采样(IS)。由此产生的序列感知价值估计能够捕捉长时序和稀疏奖励问题中的关键时间结构。在局部运动基准测试上,我们进一步证明冻结评论家参数若干步可使我们的更新与CrossQ的核心思想兼容,从而在没有目标网络的情况下实现稳定训练。尽管其实现简单——一个2层Transformer,隐藏单元数为128-256,最大更新-数据比(UTD)为1——该方法始终优于标准SAC和强离线策略基线,在长轨迹控制上尤其表现突出。这些结果强调了评论家端的序列建模和N步自举对长时序强化学习的价值。
引用
@article{arxiv.2503.03660,
title = {Chunking the Critic: A Transformer-based Soft Actor-Critic with N-Step Returns},
author = {Dong Tian and Onur Celik and Gerhard Neumann},
journal= {arXiv preprint arXiv:2503.03660},
year = {2025}
}
备注
34 pages, 15 figures, ICLR2026 under review