面向分布迁移的离线强化学习:DiSA-IQL
机器人学
2025-10-02 v1 人工智能
摘要
软蛇形机器人在复杂环境中展现出惊人的灵活性和适应性,但其控制仍具有挑战性 due to 高度非线性动力学。现有的基于模型的和仿生控制器依赖于简化假设,限制了性能。深度强化学习 (DRL) 近期作为一种有前景的替代方案,但在线训练往往不切实际,因为需要昂贵且可能损坏的真实世界交互。离线强化学习通过利用预收集的数据集提供了更安全的选择,但因分布迁移导致的泛化性能下降。为克服这一挑战,我们提出了 DiSA-IQL (Distribution-Shift-Aware Implicit Q-Learning),这是一种对 IQL 的扩展,采用惩罚不可靠状态-动作对以缓解分布迁移的方法。我们在分布内和分布外评估情境下对 DiSA-IQL 在目标到达任务上进行评估。仿真结果表明,DiSA-IQL 在包括行为克隆 (BC)、保守 Q 学习 (CQL) 和基础 IQL 等基线模型之外,始终实现了更高的成功率、更平滑的轨迹以及更好的鲁棒性。我们开源代码以支持可重复性研究,并推动进一步在软体机器人控制领域开展离线强化学习研究。
引用
@article{arxiv.2510.00358,
title = {DiSA-IQL: Offline Reinforcement Learning for Robust Soft Robot Control under Distribution Shifts},
author = {Linjin He and Xinda Qi and Dong Chen and Zhaojian Li and Xiaobo Tan},
journal= {arXiv preprint arXiv:2510.00358},
year = {2025}
}