中文

SOE:通过流形上探索实现样本高效的机器人策略自我改进

机器人学 2025-09-24 v1 人工智能 机器学习

摘要

智能体通过积极探索环境不断完善自身能力而进步。然而,机器人策略常因动作模式坍缩而缺乏足够的探索能力。现有鼓励探索的方法通常依赖随机扰动,这不仅不安全,还会引发不稳定、不规律的行为,从而限制了其有效性。我们提出了通过流形上探索实现自我改进(SOE)框架,该框架增强了机器人操作中的策略探索与改进。SOE 学习任务相关因素的紧凑潜在表示,并将探索约束在有效动作的流形上,从而确保安全性、多样性和有效性。它可以作为即插即用模块与任意策略模型无缝集成,在不降低基础策略性能的情况下增强探索。此外,结构化的潜在空间支持人类引导的探索,进一步提高了效率和可控性。在仿真和真实世界任务中的大量实验表明,SOE 始终优于先前的方法,实现了更高的任务成功率、更平滑安全的探索以及更优的样本效率。这些结果确立了流形上探索作为实现高效样本策略自我改进的一种原则性方法。项目网站:https://ericjin2002.github.io/SOE

关键词

引用

@article{arxiv.2509.19292,
  title  = {SOE: Sample-Efficient Robot Policy Self-Improvement via On-Manifold Exploration},
  author = {Yang Jin and Jun Lv and Han Xue and Wendi Chen and Chuan Wen and Cewu Lu},
  journal= {arXiv preprint arXiv:2509.19292},
  year   = {2025}
}