中文

从演示视频中学习视觉可供性定位

计算机视觉与模式识别 2021-08-13 v1

摘要

视觉可供性定位旨在从图像/视频中分割人与物体之间所有可能的交互区域,对机器人抓取、动作识别等诸多应用有益。现有方法主要依赖物体外观特征分割图像各区域,面临如下两个问题:(i)物体中存在多个可供人交互的潜在区域;(ii)同一物体区域存在多种潜在人体交互。为解决这些问题,我们提出手辅助可供性定位网络(HAG-Net),利用演示视频中手的位置与动作所提供的辅助线索,消除多种可能性并更好地定位物体中的交互区域。具体而言,HAG-Net采用双分支结构处理演示视频与物体图像。视频分支引入手辅助注意力以增强各视频帧中手周围区域,随后用LSTM网络聚合动作特征。物体分支引入语义增强模块(SEM)使网络依据动作类别关注物体不同部位,并利用蒸馏损失对齐物体分支与视频分支的输出特征,将视频分支知识迁移至物体分支。在两个具挑战性数据集上的定量与定性评估表明,我们的方法在可供性定位上取得了SOTA结果。源代码将公开。

关键词

引用

@article{arxiv.2108.05675,
  title  = {Learning Visual Affordance Grounding from Demonstration Videos},
  author = {Hongchen Luo and Wei Zhai and Jing Zhang and Yang Cao and Dacheng Tao},
  journal= {arXiv preprint arXiv:2108.05675},
  year   = {2021}
}