LoLA:面向通用机器人操作的长时程潜在动作学习
机器人学
2025-12-24 v1
摘要
执行长时程、语言引导的机器人操作任务的能力,关键依赖于利用历史信息和生成连贯的动作序列。然而,这一能力常被现有的视觉-语言-动作(VLA)模型所忽视。为解决此挑战,我们提出LoLA(Long Horizon Latent Action Learning),一个专为机器人操作设计的框架,集成长期多视角观测与机器人感知,实现多步推理与动作生成。首先,我们利用视觉-语言模型对历史序列和多视角观测中的丰富上下文特征进行编码。随后,我们引入关键模块——状态感知潜在重表征——将视觉输入和语言指令转化为可操作的机器人运动空间。与现有VLA方法仅拼接机器人感知(如关节角度)与VL嵌入不同,此模块利用机器人状态,通过可学习的“具身锚定”潜在空间显式地将VL表示锚定到物理尺度。我们在多样化的机器人预训练数据集上训练LoLA,并在仿真基准(SIMPLER和LIBERO)以及Franka和Bi-Manual Aloha机器人上的两个真实任务进行广泛评估。结果表明,LoLA在长时程操作任务中显著优于先前的SOTA方法(如pi0)。
引用
@article{arxiv.2512.20166,
title = {LoLA: Long Horizon Latent Action Learning for General Robot Manipulation},
author = {Xiaofan Wang and Xingyu Gao and Jianlong Fu and Zuolei Li and Dean Fortier and Galen Mullins and Andrey Kolobov and Baining Guo},
journal= {arXiv preprint arXiv:2512.20166},
year = {2025}
}