中文

将离线预训练集成到在线微调中:基于强化学习的机器人社交导航

机器人学 2025-10-02 v1 人工智能

摘要

离线强化学习(RL)作为解决机器人社交导航挑战的有前景的框架。然而,由于行人行为内在不确定性以及训练期间环境互动有限,往往导致探索次优且离线训练与在线部署之间存在分布偏移。为克服这些限制,本文提出了一种 novel 的离线到在线微调强化学习算法,用于机器人社交导航,通过将Return-to-Go(RTG)预测集成到因果Transformer架构中。我们的算法 features 一种时空融合模型,用于精确估计RTG值。该RTG预测框架通过对齐离线策略训练与在线环境互动来缓解分布偏移。此外,构建了混合离线-在线经验采样机制,以稳定微调期间的策略更新,确保预训练知识与实时适应的平衡集成。大量在模拟社交导航环境中的实验表明,我们的方法在成功率和碰撞率方面均优于当前最先进的基线。这些结果凸显了该算法在增强导航策略鲁性和适应性方面的有效性。这一工作为在实际应用中实现更可靠和自适应的机器人导航系统铺平了道路。

关键词

引用

@article{arxiv.2510.00466,
  title  = {Integrating Offline Pre-Training with Online Fine-Tuning: A Reinforcement Learning Approach for Robot Social Navigation},
  author = {Run Su and Hao Fu and Shuai Zhou and Yingao Fu},
  journal= {arXiv preprint arXiv:2510.00466},
  year   = {2025}
}