中文

VPWEM:具备工作记忆与情景记忆的非马尔可夫视觉运动策略

机器人学 2026-03-06 v1 人工智能 机器学习

摘要

从人类演示中进行模仿学习在机器人控制领域取得了显著成功,但大多数视觉运动策略仍仅依赖单步观察或短时历史信息,导致其在需要长期记忆的非马尔可夫任务中表现不佳。仅通过扩大上下文窗口会带来巨大的计算和内存开销,并易导致对虚假关联的过拟合,在分布迁移时会出现灾难性失败,违反机器人系统的实时性要求。相比之下,人类能够将重要的过去经验压缩存储为长期记忆,并在一生中持续利用它们来解决任务。本文提出了VPWEM(Visuomotor Policy with Working and Episodic Memory),一种具备工作记忆和情景记忆的非马尔可夫视觉运动策略。VPWEM保留最近观察令牌的滑动窗口作为短期工作记忆,引入基于Transformer的上下文记忆压缩器,递归地将超出窗口范围的观察转换为固定数量的情景记忆令牌。该压缩器利用对过去摘要令牌的自注意力和对历史观察的跨注意力,与策略一起进行联合训练。我们在扩散策略上实现VPWEM,以几乎恒定的内存和计算量在动作生成中利用短期和整体情景信息。实验表明,VPWEM在MIKASA和MoMaRT基准上的记忆密集型操作任务上,分别比包括扩散策略和视觉语言动作(VLA)模型在性能上提升超过20%和平均5%。代码已公开于https://github.com/HarryLui98/code_vpwem。

关键词

引用

@article{arxiv.2603.04910,
  title  = {VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory},
  author = {Yuheng Lei and Zhixuan Liang and Hongyuan Zhang and Ping Luo},
  journal= {arXiv preprint arXiv:2603.04910},
  year   = {2026}
}