学习恰当行动:从图像中预测与解释可供性
计算机视觉与模式识别
2018-06-18 v2
摘要
我们处理真实世界中出现的多样场景下的可供性推理问题。可供性将智能体的动作与其在周围物体上执行时的效果联系起来。在我们的工作中,我们采用场景的自我中心视角,旨在推理尊重物理世界以及社会所施加社会规范的动作-物体可供性。我们也旨在教导人工智能体为何某些动作不应在特定情境下执行,以及若执行这些动作可能会发生什么。我们收集了一个基于 ADE20k 构建的新数据集,称为 ADE-Affordance,其包含支持此类丰富视觉推理的标注。我们提出一个利用图神经网络(Graph Neural Networks)传播场景上下文信息以对每个物体执行详细可供性推理的模型。我们的模型通过多种消融研究展示,指出了这一复杂任务中的成功与挑战。
引用
@article{arxiv.1712.07576,
title = {Learning to Act Properly: Predicting and Explaining Affordances from Images},
author = {Ching-Yao Chuang and Jiaman Li and Antonio Torralba and Sanja Fidler},
journal= {arXiv preprint arXiv:1712.07576},
year = {2018}
}