中文

面向通用空间智能的可扩展多任务强化学习在视觉运动代理中的应用

机器人学 2025-08-01 v1 人工智能

摘要

虽然强化学习 (RL) 在语言建模方面取得了显著成功,但其在视觉运动代理上的应用尚未完全实现。RL 模型的一个主要挑战是倾向于过度拟合特定任务或环境,从而阻碍了在多样化环境中获取通用行为的能力。本文通过表明 RL 微调后的视觉运动代理在 Minecraft 中能够实现对未见世界的零样本泛化,为解决这一挑战提供了初步答案。具体而言,我们探讨了 RL 提升视觉运动代理在三维世界中通用空间推理和交互能力的潜力。为解决多任务 RL 表征中的挑战,我们分析并确立了跨视图目标指定作为视觉运动策略的统一多任务目标空间。 Furthermore, 为克服手动任务设计的主要瓶颈,我们提出了在高度可定制的 Minecraft 环境中进行自动任务合成,以支持大规模多任务 RL 训练,并构建了高效的分布式 RL 框架以支持这一目标。实验结果表明,RL 将交互成功率提高了 4×4\times,并实现了在多样化环境(包括真实环境)中的空间推理零样本泛化。我们的发现凸显了在适合大规模任务生成的三维仿真环境中进行 RL 训练的巨大潜力,这对于显著 advancing 视觉运动代理的空间推理具有重要意义。

关键词

引用

@article{arxiv.2507.23698,
  title  = {Scalable Multi-Task Reinforcement Learning for Generalizable Spatial Intelligence in Visuomotor Agents},
  author = {Shaofei Cai and Zhancun Mu and Haiwen Xia and Bowei Zhang and Anji Liu and Yitao Liang},
  journal= {arXiv preprint arXiv:2507.23698},
  year   = {2025}
}