SITCOM:面向视觉-语言-动作模型的推理时间计算扩展
机器人学
2025-10-07 v1
摘要
鲁棒机器人控制策略的学习仍面临高成本的数据标注、对未见环境的有限泛化以及在长时程规划中困难重重。虽然视觉-语言-动作(Vision-Language-Action, VLA)模型提供了可行之路,通过将自然语言指令映射为单步控制命令,但它们往往缺乏前瞻机制,且在动态任务中难以应对误差累积。为此,本项目引入 SITCOM(Scaling Inference-Time COMpute for VLAs),一种为 VLA 提供模型基准滚动和基于奖励的轨迹选择框架,灵感来自模型预测控制算法。SITCOM 利用学习得到的动态模型模拟多步动作滚动,以选择最佳候选计划用于实际执行,将单次 VLAs 转化为稳健的长时程规划器。我们开发了基于大规模 BridgeV2 数据训练并在 SIMPLER 环境中微调以弥合 Real2Sim 鸿沟的高效 transformer 动态模型,并利用模拟器中的奖励对候选滚动进行评分。在 SIMPLER 环境中的多项任务和设置中进行了全面评估,结果表明,结合良好奖励函数的 SITCOM 可将任务完成率从 48% 提升至 72%。
引用
@article{arxiv.2510.04041,
title = {SITCOM: Scaling Inference-Time COMpute for VLAs},
author = {Ayudh Saxena and Harsh Shah and Sandeep Routray and Rishi Rajesh Shah and Esha Pahwa},
journal= {arXiv preprint arXiv:2510.04041},
year = {2025}
}
备注
Accepted at the NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI (SpaVLE). *Equal contribution