利用生成式图像修复技术建模 Raven 渐进矩阵智力测验中的格式塔视觉推理
计算机视觉与模式识别
2019-11-27 v2 机器学习
图像与视频处理
摘要
心理学家认为 Raven 渐进矩阵是检验人类一般智力的非常有效的测验。尽管 AI 界已开发许多计算模型来研究测验中不同形式的自上而下、审慎推理,但对于自下而上的感知过程(如格式塔图像补全)的研究较少,而后者在人类测验表现中同样关键。本工作中,我们探究如何利用计算机视觉中的生成式图像修复技术建模 Raven 测验上的格式塔视觉推理。我们证明,仅在写实物体图像上训练的自监督修复模型在 Colored Progressive Matrices 上取得 27/36 分,相当于九岁儿童的平均表现。我们也表明在其他数据集(人脸、场景和纹理)上训练的模型表现不佳。我们的结果说明,学习真实世界图像中的视觉规律可转化为对人工测验刺激的成功推理。另一方面,结果也凸显了此类迁移的局限性,或可解释为何像 Raven 这样的智力测验常对个体的社会文化背景敏感。
引用
@article{arxiv.1911.07736,
title = {Modeling Gestalt Visual Reasoning on the Raven's Progressive Matrices Intelligence Test Using Generative Image Inpainting Techniques},
author = {Tianyu Hua and Maithilee Kunda},
journal= {arXiv preprint arXiv:1911.07736},
year = {2019}
}