理解、组合与响应——通过抽象过程组合回答视觉问题
计算机视觉与模式识别
2018-10-26 v1
摘要
一个与图像相关的问题定义了为产生恰当答案所需执行的特定视觉任务。答案可能依赖于图像中的微小细节,并需要复杂推理和先验知识的使用。当人类执行该任务时,能够以灵活且鲁棒的方式完成,将任何新颖视觉能力模块化地集成到针对任务各种细化的多样选项中。相比之下,当前用机器解决此问题的方法基于将问题视为端到端学习问题,缺乏此类能力。我们受前述人类能力启发,提出一种不同方法。该方法基于问题的组合结构。其底层思想是,问题具有基于其结构的抽象表示,该表示本质上是组合性的。因此问题可通过对应于其子结构的程序组合来回答。表示的基本元素是逻辑模式,它们被组合在一起表示问题。这些模式包含对象类别、属性和关系的参数化表示。每个基本模式被映射到一个包含有意义视觉任务的基本程序,这些模式被组合以产生整体回答程序。基于该方法的 UnCoRd (Understand Compose and Respond) 系统,集成了针对一组对象类别、属性和关系的现有检测与分类方案。这些方案以模块化方式被纳入,为负答案提供详尽回答与修正。此外,外部知识库被查询以获取所需的常识。我们对系统进行了定性分析,展示了其表示能力并给出未来发展建议。
引用
@article{arxiv.1810.10656,
title = {Understand, Compose and Respond - Answering Visual Questions by a Composition of Abstract Procedures},
author = {Ben Zion Vatashsky and Shimon Ullman},
journal= {arXiv preprint arXiv:1810.10656},
year = {2018}
}