检索后引导:面向生成式 VLA 测试时适应的在线成功记忆
机器人学
2026-05-13 v2 人工智能
摘要
视觉-语言-动作(VLA)模型在通用机器人操作方面展现出巨大潜力,但其闭环可靠性在局部部署条件下经常会下降。现有的评估通常将测试片段视为独立的零样本试验。然而,真实的机器人经常在相同或缓慢变化的环境中重复运行,其中成功的执行提供了可靠行为模式的环境验证证据。我们研究这种持续部署设置,询问一个部分胜任的冻结 VLA 是否可以通过重用其成功的测试时经验来提高其可靠性。我们提出了一个用于生成式 VLA 的在线成功记忆引导的测试时适应框架。在部署期间,机器人将进度校准后的成功观测-动作片段存储在长期记忆中。在推理时,它检索与状态相关的动作块,通过轨迹级一致性过滤不一致的候选者,并将它们聚合为精英动作先验。为了将此先验纳入动作生成,我们引入了置信度自适应先验引导,它将精英先验注入流匹配动作采样器的中间状态,并根据检索置信度调整引导强度。这种设计允许冻结的 VLA 利用特定于环境的成功经验,同时保持基于观测条件的生成式细化。这种检索后引导机制实现了轻量级、非参数化的测试时适应,而无需参数更新。仿真和真实世界实验表明,任务成功率和闭环稳定性得到提高,特别是在长时程和多阶段任务中。
引用
@article{arxiv.2605.10094,
title = {Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs},
author = {Jianchao Zhao and Huoren Yang and Yusong Hu and Yuyang Gao and Qiguan Ou and Cong Wan and SongLin Dong and Zhiheng Ma and Yihong Gong},
journal= {arXiv preprint arXiv:2605.10094},
year = {2026}
}