中文

原子动作切片:通用视觉-语言-动作智能体的规划对齐选项

机器学习 2025-12-15 v1 人工智能 机器人学

摘要

当前视觉-语言-动作(VLA)模型在需要新技能或对象的组合时难以泛化。我们提出原子动作切片(AAS),一种规划对齐的方法,将长期演示分解为短且类型化的原子动作,便于规划器使用和策略学习。使用 LIBERO 演示,AAS 生成了一套由动作类型、时间跨度和置信度标记的经验证的 2,124 个原子片段数据集。一个更强的分割器(Gemini 2.5 Pro)与规划器定义的计划 closely match,且在关键帧抖动情况下仍稳健,而较小的模型在多对象任务上表现较差。对 CLIP-RT+ 在原子数据集上的微调,可将 LIBERO-Goal 上的任务成功率从 94.2% 提升至 95.3%,LIBERO-Long 上从 83.8% 提升至 88.8%。我们将在 HuggingFace(https://huggingface.co/datasets/gate-institute/GATE-VLAP-datasets)公开发布 GATE-VLAP 数据集。

关键词

引用

@article{arxiv.2512.11584,
  title  = {Atomic Action Slicing: Planner-Aligned Options for Generalist VLA Agents},
  author = {Stefan Tabakov and Asen Popov and Dimitar Dimitrov and S. Ensiye Kiyamousavi and Vladimir Hristov and Boris Kraychev},
  journal= {arXiv preprint arXiv:2512.11584},
  year   = {2025}
}

备注

The 41st ACM/SIGAPP Symposium On Applied Computing