来自外中心视角的可供性定位
计算机视觉与模式识别
2023-05-26 v2
摘要
可供性定位(affordance grounding)旨在定位物体的“动作可能性”区域,是迈向具身智能的关键一步。由于交互可供性的多样性,不同个体的独特性导致多样的交互,这使得在物体部件与可供性标签之间建立显式关联十分困难。人类具备将多样的外中心(exocentric)交互转化为不变的内中心(egocentric)可供性以抵消交互多样性影响的能力。为赋予智能体此种能力,本文提出一项外中心视角下的可供性定位任务,即给定外中心人-物交互与内中心物体图像,仅以可供性标签作为监督,学习物体的可供性知识并将其迁移到内中心图像。然而,不同人物间存在某些“交互偏置”,主要涉及不同区域与不同视角。为此,我们设计了一个跨视角可供性知识迁移框架,从外中心交互中提取可供性特定特征,并将其迁移至内中心视角。具体而言,通过保持可供性共关系来增强对可供性区域的感知。此外,我们通过收集并标注来自个可供性类别的超过20K张图像,构建了名为AGD20K的可供性定位数据集。实验结果表明,我们的方法在客观指标与视觉质量上均优于代表性模型。代码发布于 https://github.com/lhc1224/Cross-view-affordance-grounding。
引用
@article{arxiv.2208.13196,
title = {Grounded Affordance from Exocentric View},
author = {Hongchen Luo and Wei Zhai and Jing Zhang and Yang Cao and Dacheng Tao},
journal= {arXiv preprint arXiv:2208.13196},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2203.09905