从异中心图像中学习功能可供性定位
计算机视觉与模式识别
2022-03-21 v1
摘要
功能可供性定位(affordance grounding)是一项在物体中定位(即,标出)动作可能性区域的任务,由于交互可供性的多样性,其面临与物体部件建立显式关联的难题。人类具备将多样的异中心交互转化为不变的中心可供性以抵消交互多样性影响的能力。为使智能体具备此种能力,本文提出一项从异中心视角进行可供性定位的任务,即给定异中心人-物交互图像与中心物体图像,仅以可供性标签作为监督,学习该物体的可供性知识并将其迁移至中心图像。为此,我们设计了一个跨视角知识迁移框架,从异中心交互中提取可供性特定特征,并通过保持可供性关联来增强对可供性区域的感知。具体而言,设计了可供性不变性挖掘模块,通过最小化异中心图像中源于交互习惯的类内差异来提取特定线索。此外,提出可供性关联保持策略,通过对齐两视角间预测结果的关联矩阵来感知并定位可供性。特别地,我们通过收集并标注来自 36 个可供性类别的超过 20K 张图像,构建了名为 AGD20K 的可供性定位数据集。实验结果表明,我们的方法在客观指标与视觉质量上均优于代表性模型。代码:github.com/lhc1224/Cross-View-AG。
引用
@article{arxiv.2203.09905,
title = {Learning Affordance Grounding from Exocentric Images},
author = {Hongchen Luo and Wei Zhai and Jing Zhang and Yang Cao and Dacheng Tao},
journal= {arXiv preprint arXiv:2203.09905},
year = {2022}
}
备注
CVPR2022