ReMem-VLA:通过双层循环查询赋予视觉-语言-动作模型记忆能力
机器人学
2026-03-16 v1
摘要
用于闭环机器人控制的视觉-语言-动作(VLA)模型通常在马尔可夫假设下构建,这使得它们在需要历史上下文的任务上容易出错。为了融入记忆,现有的VLA要么从记忆库中检索(可能被干扰物误导),要么扩展帧窗口(其固定视界仍然限制了长期保留)。在本文中,我们介绍了ReMem-VLA,一种循环记忆VLA模型,配备了两组可学习查询:用于跨连续帧传播信息以支持短期记忆的帧级循环记忆查询,以及用于跨时间块携带上下文以实现长期记忆的块级循环记忆查询。这些查询经过端到端训练,以随时间聚合和维持相关上下文,隐式地指导模型决策,而无需额外的训练或推理成本。此外,为了增强视觉记忆,我们引入了过去观测预测作为辅助训练目标。通过广泛的以记忆为中心的仿真和真实世界机器人实验,我们证明ReMem-VLA在多个维度上表现出强大的记忆能力,包括空间、顺序、情节、时间和视觉记忆。ReMem-VLA显著优于无记忆的VLA基线π0.5和OpenVLA-OFT,并在记忆依赖型任务上大幅超越MemoryVLA。
引用
@article{arxiv.2603.12942,
title = {ReMem-VLA: Empowering Vision-Language-Action Model with Memory via Dual-Level Recurrent Queries},
author = {Hang Li and Fengyi Shen and Dong Chen and Liudi Yang and Xudong Wang and Jinkui Shi and Zhenshan Bing and Ziyuan Liu and Alois Knoll},
journal= {arXiv preprint arXiv:2603.12942},
year = {2026}
}
备注
14 pages, 6 figures