面向弱监督可供性定位的选择性对比学习
计算机视觉与模式识别
2025-08-12 v1 人工智能
摘要
促进实体与物体的交互需要准确识别出提供特定动作的可供性部件。弱监督可供性定位(WSAG)旨在模仿人类从第三人称演示中学习的方式,即人类无需像素级标注就能直观地掌握功能部件。为实现这一点,定位通常通过跨不同视角图像共享的分类器以及结合部件发现过程的蒸馏策略来学习。然而,由于与可供性相关的部件并不总是容易区分,模型主要依赖分类,常常关注与可供性无关的常见类别特定模式。为了解决这一局限性,我们超越了孤立的部件级学习,引入了选择性原型和像素对比目标,这些目标根据可用信息的粒度,在部件和物体两个层面上自适应地学习与可供性相关的线索。首先,我们利用 CLIP 在以自我为中心(物体聚焦)和以外部为中心(第三人称示例)的图像中找到与动作相关的物体。然后,通过交叉引用互补视角下发现的物体,我们挖掘出每个视角中精确的部件级可供性线索。通过持续学习区分可供性相关区域与可供性无关的背景上下文,我们的方法有效地将激活从无关区域转移到有意义的可供性线索上。实验结果证明了我们方法的有效性。代码可在 github.com/hynnsk/SelectiveCL 获取。
引用
@article{arxiv.2508.07877,
title = {Selective Contrastive Learning for Weakly Supervised Affordance Grounding},
author = {WonJun Moon and Hyun Seok Seong and Jae-Pil Heo},
journal= {arXiv preprint arXiv:2508.07877},
year = {2025}
}
备注
Accepted to ICCV 2025