面向视觉问答的场景图推理
机器学习
2020-07-03 v1 计算机视觉与模式识别
机器学习
摘要
视觉问答旨在回答关于图像的开放式问题。由于该任务需要对问题有深入的语言理解,并能够将其与图像中存在的各种对象相关联,因此是一项极具挑战性的任务,需要结合计算机视觉与自然语言处理的技术。我们提出了一种新颖的方法,通过基于图像中对象及其语义与空间关系进行上下文驱动的顺序推理来处理该任务。作为第一步,我们推导出描述图像中对象及其属性与相互关系的场景图。随后,一个强化学习智能体学习自主地在提取出的场景图上导航以生成路径,这些路径进而作为推导答案的基础。我们在具有人工精心构建场景图的具有挑战性的 GQA 数据集上进行了初步实验研究,我们的方法几乎达到了人类表现的水平。
引用
@article{arxiv.2007.01072,
title = {Scene Graph Reasoning for Visual Question Answering},
author = {Marcel Hildebrandt and Hang Li and Rajat Koner and Volker Tresp and Stephan Günnemann},
journal= {arXiv preprint arXiv:2007.01072},
year = {2020}
}
备注
ICML Workshop Graph Representation Learning and Beyond (GRL+)