中文

Affogato:通过大规模自动化数据生成学习开放词汇可供性定位

计算机视觉与模式识别 2025-06-16 v1

摘要

可供性定位——基于自然语言交互描述定位物体区域——是使智能体理解和交互环境的关键挑战。然而,该任务仍然具有挑战性,原因包括需要细粒度的部件级定位、多个有效交互区域带来的歧义,以及大规模数据集的匮乏。在本工作中,我们引入Affogato,一个包含150K实例的大规模基准数据集,标注了开放词汇文本描述和对应3D可供性热图,覆盖多样化的物体和交互。基于该基准,我们开发了简单而有效的视觉-语言模型,利用预训练的部件感知视觉骨干网络和文本条件热图解码器。用Affogato数据集训练的模型在现有2D和3D基准上取得了有前景的性能,并且在开放词汇跨域泛化方面表现出显著效果。Affogato数据集已公开发布:https://huggingface.co/datasets/project-affogato/affogato

关键词

引用

@article{arxiv.2506.12009,
  title  = {Affogato: Learning Open-Vocabulary Affordance Grounding with Automated Data Generation at Scale},
  author = {Junha Lee and Eunha Park and Chunghyun Park and Dahyun Kang and Minsu Cho},
  journal= {arXiv preprint arXiv:2506.12009},
  year   = {2025}
}