中文

DREAMer-VXS:面向随机、未观测环境下样本高效 AGV 探索的潜在世界模型

机器人学 2025-12-02 v1

摘要

基于学习的机器人范式拥有巨大的潜力,但其向现实世界的转化严重受制于样本效率低下和传统无模型强化学习算法的脆弱性。本文通过引入 DREAMer-VXS,一个面向自主地面车辆(AGV)探索的数据驱动框架来解决这些挑战。该框架学习从想象的潜在轨迹中进行规划。我们的方法核心在于从部分高维激光雷达观测中学习一个全面的世界模型。该世界模型由卷积变分自编码器(VAE)构成,用于学习环境结构的紧凑表示,以及递归状态空间模型(RSSM)用于建模复杂的时间动态。通过利用所学习的模型作为高速模拟器,智能体几乎完全在想象中训练其导航策略。该方法将策略学习与真实世界交互解耦,使其在比较当前最先进的无模型 SAC 基线时,仅需约 90% 的环境交互次数即可达到专家水平的性能。该智能体的行为由一个演员-评论家策略驱动,采用兼顾任务目标与内在好奇心奖励的复合奖励函数,以促进对未知空间的系统性探索。我们通过大量仿真实验展示,DREAMer-VXS 不仅学习速度快了数量级,还能开发出更具可迁移性和鲁棒性的策略,在未见环境中实现探索效率提升 45%,并对动态障碍物表现出优异的鲁棒性。

关键词

引用

@article{arxiv.2512.00005,
  title  = {DREAMer-VXS: A Latent World Model for Sample-Efficient AGV Exploration in Stochastic, Unobserved Environments},
  author = {Agniprabha Chakraborty},
  journal= {arXiv preprint arXiv:2512.00005},
  year   = {2025}
}