中文

用于视觉-语言-动作模型的无验证器测试时采样

机器人学 2025-10-08 v1 人工智能 机器学习

摘要

视觉-语言-动作模型(VLAs)在机器人控制中展现了显著的性能。然而,它们在需要高精度的任务中仍然受到单推理范式的根本限制。虽然使用外部验证器的测试时扩展方法已显示出前景,但它们需要额外的训练,且无法泛化到未见条件。我们提出掩码分布引导选择(MG-Select),一种用于 VLAs 的新型测试时扩展框架,它利用模型的内部属性,无需额外的训练或外部模块。我们的方法利用参考动作令牌分布的 KL 散度作为置信度度量,从多个候选动作中选择最优动作。我们引入了一种参考分布,由相同的 VLA 生成,但输入为随机屏蔽的状态和语言条件,在保持与目标任务分布对齐的同时确保最大不确定性。此外,我们提出了一种联合训练策略,通过在状态和语言条件上应用 dropout,使模型能够同时学习条件分布和无条件分布,从而进一步改善参考分布的质量。实验表明,MG-Select 实现了显著的性能提升,包括在真实世界的分布内/分布外任务上分别提升 28%/35%,以及在 RoboCasa 抓取放置任务上相对于使用 30 个演示训练获得 168% 的相对增益。

关键词

引用

@article{arxiv.2510.05681,
  title  = {Verifier-free Test-Time Sampling for Vision Language Action Models},
  author = {Suhyeok Jang and Dongyoung Kim and Changyeon Kim and Youngsuk Kim and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2510.05681},
  year   = {2025}
}

备注

14 pages; 3 figures