AnySlot:用于零样本插槽级放置的目标条件视觉语言动作策略
机器人学
2026-04-15 v2
摘要
视觉语言动作(VLA)策略已成为通用机器人操作的一种灵活范式。然而,在组合化语言指令下实现精确的对象放置,仍是现代单体VLA策略面临的主要挑战。插槽级任务需要可靠的插槽定位以及亚厘米级执行精度。为此,我们提出了AnySlot,一种通过引入显式空间视觉目标作为语言定位与控制之间之间的中间表示,以降低组合化复杂度的框架。AnySlot通过生成场景标记将语言转换为显式视觉目标,然后使用以目标为条件的VLA策略执行该目标。这种层次化设计有效地将高级插槽选择与低级执行解耦,确保了语义准确性和空间鲁棒性。此外,鉴于现有基准对此类精密需求任务缺乏评估, 我们引入了SlotBench,一个包含九个任务类别的综合性仿真基准,旨在评估插槽级放置中的结构化空间推理。大量实验表明,AnySlot在零样本插槽级放置方面显著优于平坦VLA基线和以前的模块化定位方法。
引用
@article{arxiv.2604.10432,
title = {AnySlot: Goal-Conditioned Vision-Language-Action Policies for Zero-Shot Slot-Level Placement},
author = {Zhaofeng Hu and Sifan Zhou and Qinbo Zhang and Rongtao Xu and Qi Su and Ci-Jyun Liang},
journal= {arXiv preprint arXiv:2604.10432},
year = {2026}
}