中文

LOCATE:面向弱监督功能可供性定位的部件局部化与迁移

计算机视觉与模式识别 2023-03-20 v1

摘要

人类擅长通过观察获取知识。例如,我们可以通过观看演示学会使用新工具。这一能力是智能系统与世界交互的基础。获取该能力的关键步骤是识别物体的哪一部分支持每种动作,称为功能可供性定位。本文针对此问题,提出名为 LOCATE 的框架,可在图像间识别匹配的物体部件,从而将知识从物体正被使用的图像(用于学习的非自我中心图像)迁移到物体静止的图像(用于测试的自我保护中心图像)。为此,我们首先寻找交互区域并提取其特征嵌入。随后我们学习将嵌入聚合成紧凑原型(人、物体部件与背景),并选择代表物体部件的原型。最后,我们利用所选原型引导功能可供性定位。我们以弱监督方式完成此过程,仅从图像级功能可供性与物体标签学习。大量实验表明,我们的方法在已见与未见物体上均以大幅优势超越最先进方法。

关键词

引用

@article{arxiv.2303.09665,
  title  = {LOCATE: Localize and Transfer Object Parts for Weakly Supervised Affordance Grounding},
  author = {Gen Li and Varun Jampani and Deqing Sun and Laura Sevilla-Lara},
  journal= {arXiv preprint arXiv:2303.09665},
  year   = {2023}
}

备注

CVPR 2023, Project page: https://reagan1311.github.io/locate/, Video: https://www.youtube.com/watch?v=RLHansdFxII