一种面向对象可供性分割的深度学习方法
计算机视觉与模式识别
2020-04-21 v1
摘要
学习理解与推断物体功能是实现鲁棒视觉智能的重要一步。近期的研究重点聚焦于分割那些支持特定类型人-物交互的物体部件,即所谓的“对象可供性(object affordances)”。然而,大多数工作将其视为静态语义分割问题,仅关注物体外观,并依赖强监督与物体检测。本文提出一种新颖方法,利用人-物交互的时空特性进行可供性分割。具体而言,我们设计了一个自编码器,仅使用序列最后一帧的真实标签进行训练,即可在视频与静态图像中推断像素级可供性标签。该模型通过软注意力机制隐式定位交互热点,从而省去了对物体标签与边界框的需求。为评估目的,我们引入了SOR3D-AFF语料库,该语料库包含人-物交互序列,并以像素级标注支持9种可供性类型,涵盖工具类物体的典型操作。我们证明,在SOR3D-AFF上,本模型取得了与强监督方法相比具有竞争力的结果,同时能够在两个仅含图像的可供性数据集上预测未见过的相似物体的可供性。
引用
@article{arxiv.2004.08644,
title = {A Deep Learning Approach to Object Affordance Segmentation},
author = {Spyridon Thermos and Petros Daras and Gerasimos Potamianos},
journal= {arXiv preprint arXiv:2004.08644},
year = {2020}
}
备注
5 pages, 4 figures, ICASSP 2020