CLIP对剥香蕉了解多少?
计算机视觉与模式识别
2024-04-19 v1
摘要
人类展现出识别工具以支持特定动作的先天能力。物体部件与其促进的动作之间的关联通常称为可供性。能够根据任务所允许的动作对物体部件进行分割,对于使智能机器人使用日常物品至关重要。传统的可供性分割监督学习方法需要昂贵的像素级标注,而弱监督方法虽然要求较低,但仍依赖于物体-交互示例,并支持封闭的动作集。这些限制阻碍了可扩展性,可能引入偏差,并通常将模型限制在有限的预定义动作集上。本文提出AffordanceCLIP,通过利用大型预训练视觉-语言模型(如CLIP)中嵌入的隐式可供性知识来克服这些限制。我们通过实验证明,尽管CLIP没有经过可供性检测的显式训练,但它保留了该任务的有价值信息。我们的AffordanceCLIP在零样本性能上与经过专门训练的方法相比具有竞争力,同时提供了几个优势:i)它适用于任何动作提示,而不仅仅是预定义集;ii)与现有解决方案相比,它只需要训练少量额外参数;iii)消除了对动作-对象对直接监督的需求,为基于功能性的模型推理开辟了新视角。
引用
@article{arxiv.2404.12015,
title = {What does CLIP know about peeling a banana?},
author = {Claudia Cuttano and Gabriele Rosi and Gabriele Trivigno and Giuseppe Averta},
journal= {arXiv preprint arXiv:2404.12015},
year = {2024}
}
备注
Accepted to MAR Workshop at CVPR2024