带Sigmoid有界熵的离线策略Actor-Critic用于真实世界机器人学习
人工智能
2026-01-23 v1
摘要
在真实世界中部署强化学习仍然具有挑战性,原因包括样本效率低、奖励稀疏和视觉观测噪声大。先前的研究利用示范和人类反馈来提高学习效率和鲁棒性。然而,离线到在线方法需要大型数据集且可能不稳定,而VLA辅助RL依赖大规模预训练和微调。因此,一种数据需求极低的真实世界RL方法尚未出现。我们提出了SigEnt-SAC,一种离线策略Actor-Critic方法,仅使用单条专家轨迹从头学习。我们的关键设计是Sigmoid有界熵项,可防止负熵驱动的优化趋向分布外动作,并减少Q函数振荡。我们在D4RL任务上对SigEnt-SAC进行了基准测试。实验表明SigEnt-SAC显著缓解了Q函数振荡,并以比先前方法更快的速度达到100%成功率。最后,我们在四个真实世界机器人任务上验证了SigEnt-SAC,涵盖多种载体,智能体从原始图像和稀疏奖励中学习;结果表明SigEnt-SAC仅需少量真实世界交互即可学习到成功的策略,这暗示了一种低成本且实用的真实世界RL部署路径。
引用
@article{arxiv.2601.15761,
title = {Off-Policy Actor-Critic with Sigmoid-Bounded Entropy for Real-World Robot Learning},
author = {Xiefeng Wu and Mingyu Hu and Shu Zhang},
journal= {arXiv preprint arXiv:2601.15761},
year = {2026}
}
备注
7 pages main text 2 page reference