PQA:感知问答
计算机视觉与模式识别
2021-04-09 v1
摘要
感知组织仍是关于人类视觉系统极少数成熟的理论之一。它支撑了许多关于分割与检测的深度学习前开创性工作,但自偏好转向学习深度模型以来相关研究迅速减少。在有限的尝试中,多数旨在利用感知组织规则解释复杂视觉场景。然而这被证明是次优的,因为模型无法有效捕捉真实世界图像中的视觉复杂性。本文重振对感知组织的研究,倡导两点立场改变:(i)我们考察专门生成的合成数据,而非复杂真实图像;(ii)我们让机器合成新颖的感知有效模式,而非解释已有数据。我们的总体答案在于引入一项新颖视觉挑战——感知问答(PQA)挑战。在观察到示例感知问答对后,PQA的目标是通过从零开始完全生成答案来解决类似问题(见图1)。因此我们的首要贡献是首个感知问答对数据集,每个问答对针对特定格式塔(Gestalt)原理专门生成。我们随后借鉴人类心理学洞见设计了一个智能体,将感知组织视为自注意力问题,其中提出的网格到网格映射网络直接从零生成答案模式。实验表明我们的智能体优于若干朴素与强基线。然而一项人类研究表明,与普通人相比,我们的方法学习所用数据量天文数字般庞大,这亟需未来研究(无论是否使用我们的数据集)。
引用
@article{arxiv.2104.03589,
title = {PQA: Perceptual Question Answering},
author = {Yonggang Qi and Kai Zhang and Aneeshan Sain and Yi-Zhe Song},
journal= {arXiv preprint arXiv:2104.03589},
year = {2021}
}
备注
Accepted by CVPR 2021