VGAS:基于价值引导的少样本视觉-语言-动作适应动作块选择
人工智能
2026-05-25 v2 计算机视觉与模式识别
摘要
视觉-语言-动作(VLA)模型将多模态推理与物理控制相结合,但在 demonstrations 稀缺时将其适应到新任务往往不可靠。虽然微调后的 VLA 策略常产生语义上合理的轨迹,但在几何模糊性未解时常会失败,近似动作会在有限监督下导致执行结果分歧。我们从生成-选择视角研究少样本 VLA 适应,提出新框架 VGAS(Value-Guided Action-Chunk Selection)。它执行推理时的 best-of-N 选择,以识别既语义忠实又几何精确的动作块。具体而言,VGAS 使用微调后的 VLA 作为高召回率的提议生成器,引入 Q-Chunk-Former—a 基于几何的 Transformer 批评家以解决细粒度几何模糊性。此外,我们提出显式几何正则化(EGR),以塑造判别性价值景观,保留在接近候选者之间保持动作排序分辨率,同时缓解稀缺监督下的价值不稳定性。实验和理论分析表明,VGAS 在有限 demonstrations 和分布迁移下显著提升成功率和鲁棒性。我们的代码已公开:https://github.com/Jyugo-15/VGAS。
引用
@article{arxiv.2602.07399,
title = {VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation},
author = {Changhua Xu and En Yu and Junyu Xuan and Jie Lu},
journal= {arXiv preprint arXiv:2602.07399},
year = {2026}
}
备注
Preprint