LOCATE:面向弱监督功能可供性定位的部件局部化与迁移
计算机视觉与模式识别
2023-03-20 v1
摘要
人类擅长通过观察获取知识。例如,我们可以通过观看演示学会使用新工具。这一能力是智能系统与世界交互的基础。获取该能力的关键步骤是识别物体的哪一部分支持每种动作,称为功能可供性定位。本文针对此问题,提出名为 LOCATE 的框架,可在图像间识别匹配的物体部件,从而将知识从物体正被使用的图像(用于学习的非自我中心图像)迁移到物体静止的图像(用于测试的自我保护中心图像)。为此,我们首先寻找交互区域并提取其特征嵌入。随后我们学习将嵌入聚合成紧凑原型(人、物体部件与背景),并选择代表物体部件的原型。最后,我们利用所选原型引导功能可供性定位。我们以弱监督方式完成此过程,仅从图像级功能可供性与物体标签学习。大量实验表明,我们的方法在已见与未见物体上均以大幅优势超越最先进方法。
引用
@article{arxiv.2303.09665,
title = {LOCATE: Localize and Transfer Object Parts for Weakly Supervised Affordance Grounding},
author = {Gen Li and Varun Jampani and Deqing Sun and Laura Sevilla-Lara},
journal= {arXiv preprint arXiv:2303.09665},
year = {2023}
}
备注
CVPR 2023, Project page: https://reagan1311.github.io/locate/, Video: https://www.youtube.com/watch?v=RLHansdFxII