中文

ArtiBench 与 ArtiBrain:面向通用视觉语言定制化物体操控的基准测试

机器人学 2025-12-01 v2 计算机视觉与模式识别

摘要

交互式定制化物体操控需要与家具进行长期、多步骤的交互,同时保持物理一致性。现有的视觉语言和扩散基方法在跨零件、跨实例、跨类别的泛化能力方面存在挑战。我们首先引入 ArtiBench——一个覆盖厨房、储存、办公和工具环境的五级基准测试。ArtiBench 实现从跨零件和跨实例变异到长期多目标任务的结构化评估,揭示了定制化物体操控的核心泛化挑战。基于此基准,我们提出 ArtiBrain——一个统一高级推理与自适应低级控制的模块化框架。ArtiBrain 使用基于视觉语言的任务推理器 (GPT-4.1) 分解和验证子目标,采用混合控制器将几何感知关键帧执行与可affordance引导扩散相结合,以实现精确且可解释的操控。Affordance 记忆库持续积累成功执行情节,向不可见的定制化零件和配置传播零件级可affordance信息。在 ArtiBench 上的大量实验表明,我们的 ArtiBrain 在鲁棒性和泛化能力方面显著优于最先进的多模态和扩散基方法。代码和数据集将在接受后发布。

关键词

引用

@article{arxiv.2511.20330,
  title  = {ArtiBench and ArtiBrain: Benchmarking Generalizable Vision-Language Articulated Object Manipulation},
  author = {Yuhan Wu and Tiantian Wei and Shuo Wang and ZhiChao Wang and Yanyong Zhang and Daniel Cremers and Yan Xia},
  journal= {arXiv preprint arXiv:2511.20330},
  year   = {2025}
}