Harness VLA:通过记忆引导代理将冻结的VLA模型引导为可靠的操作原语
机器人学
2026-07-09 v1
摘要
语言条件操作需要精确的接触丰富控制以及对语言、场景和长时程的鲁棒推理。端到端的视觉-语言-动作(VLA)模型提供了强大的局部视觉运动技能,但它们在分布内的任务轨迹上训练,在部署扰动(如语义重定向、目标重新绑定、空间布局变化和不稳定的局部接触)下常常失败。LLM编码代理提供了互补的语义和组合推理,但纯粹的分析性原语在处理不规则抓取、受限放置和铰接物体交互方面存在困难。我们提出了Harness VLA,一个记忆增强的代理框架,它将冻结的VLA暴露为可重试的接触丰富原语,并将其与一个小的固定分析原语库组合,用于接地、暂存、运输、导航和释放。该框架不是扩展技能库,而是从特定任务的执行轨迹、全局成功规则和失败模型中学习这些固定原语的操作范围。通过将语义重新接地、非接触执行和VLA重新暂存提升到规划器,同时保留冻结的VLA用于局部接触丰富阶段,Harness VLA在无需微调的情况下将预训练的VLA扩展到其原始轨迹分布之外。在受扰动的桌面、家庭厨房和从干净到随机化的双臂操作中,Harness VLA在LIBERO-Pro和RoboCasa365上分别比最强相关基线提高了38.6和25.4个百分点,并在RoboTwin C2R上达到了58.4%。
引用
@article{arxiv.2607.08448,
title = {Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents},
author = {Yixian Zhang and Huanming Zhang and Feng Gao and Xiao Li and Zhihao Liu and Chunyang Zhu and Jiaxing Qiu and Yuchen Yan and Jiyuan Liu and Wenhao Tang and Zhengru Fang and Yi Nie and Changxu Wei and Yu Wang and Wenbo Ding and Chao Yu},
journal= {arXiv preprint arXiv:2607.08448},
year = {2026}
}