超越短视程:VQ-Memory 用于非马尔可夫仿真基准中的稳健长程操作
机器人学
2026-03-19 v2
摘要
收集真实机器人数据的高成本使机器人仿真成为可扩展的评估和数据生成平台。然而,大多数现有基准集中于简单操作任务如抓取-放置,无法捕捉真实世界任务的非马尔可夫特性以及关节物体相互作用的复杂性。为此,我们提出 RuleSafe,一个基于可扩展 LLM 辅助仿真框架构建的新型关节操作基准。RuleSafe 包含各种开启机制的 safes,如钥匙锁、密码锁和逻辑锁,需要不同的多阶段推理和操作策略。这些 LLM 生成的规则产生非马尔可夫且长程任务,需要时间建模和记忆驱动的推理。我们进一步提出 VQ-Memory,一种紧凑且结构化的时间表示方法,使用向量量化变分自编码器 (VQ-VAE) 将过去的感性状态编码为离散潜在标记。该表示过滤低频噪声,同时保留高层次任务阶段语境,提供轻量且稳健的时间线索,兼容现有的视觉语言-动作模型 (VLA)。在最新 VLA 模型和扩散策略上进行大量实验表明,VQ-Memory 在长程计划中一致性地提升,增强了对未见配置的泛化,并以更低的计算成本实现更高效的操作。项目页面:vqmemory.github.io
引用
@article{arxiv.2603.09513,
title = {Beyond Short-Horizon: VQ-Memory for Robust Long-Horizon Manipulation in Non-Markovian Simulation Benchmarks},
author = {Honghui Wang and Zhi Jing and Jicong Ao and Shiji Song and Xuelong Li and Gao Huang and Chenjia Bai},
journal= {arXiv preprint arXiv:2603.09513},
year = {2026}
}
备注
9 pages