中文

真实场景中的一次性物体可供性检测

计算机视觉与模式识别 2021-08-10 v1

摘要

可供性检测指识别图像中物体的潜在动作可能性,这是机器人感知与操作的关键能力。为使机器人在未知场景中具备该能力,本文首次研究了具有挑战性的一次性可供性检测问题,即给定一张描述动作目的的支持图像,应检测出场景中所有具有该共同可供性的物体。为此,我们设计了一次性可供性检测网络(OSAD-Net),其首先估计人类动作目的,再将其迁移以辅助从所有候选图像中检测共同可供性。通过协作学习,OSAD-Net能捕捉具有相同底层可供性的物体间的共同特征,并学习良好的适应能力以感知未知可供性。此外,我们通过收集并标注来自39个可供性与103个物体类别的30k图像,构建了大规模目的驱动可供性数据集v2(PADv2)。凭借复杂场景与丰富标注,我们的PADv2数据集可作为基准测试平台评估可供性检测方法,并可能促进下游视觉任务,如场景理解、动作识别与机器人操作。具体地,我们在PADv2数据集上纳入来自多个相关领域的11个先进模型进行了综合实验。实验结果证明了我们的模型在客观指标与视觉质量上均优于以往代表性模型。基准套件见 https://github.com/lhc1224/OSAD Net。

关键词

引用

@article{arxiv.2108.03658,
  title  = {One-Shot Object Affordance Detection in the Wild},
  author = {Wei Zhai and Hongchen Luo and Jing Zhang and Yang Cao and Dacheng Tao},
  journal= {arXiv preprint arXiv:2108.03658},
  year   = {2021}
}