中文

学习恰当行动:从图像中预测与解释可供性

计算机视觉与模式识别 2018-06-18 v2

摘要

我们处理真实世界中出现的多样场景下的可供性推理问题。可供性将智能体的动作与其在周围物体上执行时的效果联系起来。在我们的工作中,我们采用场景的自我中心视角,旨在推理尊重物理世界以及社会所施加社会规范的动作-物体可供性。我们也旨在教导人工智能体为何某些动作不应在特定情境下执行,以及若执行这些动作可能会发生什么。我们收集了一个基于 ADE20k 构建的新数据集,称为 ADE-Affordance,其包含支持此类丰富视觉推理的标注。我们提出一个利用图神经网络(Graph Neural Networks)传播场景上下文信息以对每个物体执行详细可供性推理的模型。我们的模型通过多种消融研究展示,指出了这一复杂任务中的成功与挑战。

关键词

引用

@article{arxiv.1712.07576,
  title  = {Learning to Act Properly: Predicting and Explaining Affordances from Images},
  author = {Ching-Yao Chuang and Jiaman Li and Antonio Torralba and Sanja Fidler},
  journal= {arXiv preprint arXiv:1712.07576},
  year   = {2018}
}