重访 Marr 的面部构建:深度神经网络中的 2D--2.5D--3D 表示的构建
计算机视觉与模式识别
2024-11-26 v1
摘要
David Marr 的视觉理论提出,人类视觉系统通过三个阶段运作,分别称为 2D 草图、2.5D 草图和 3D 模型。在近年来,深度神经网络 (DNN) 被认为已达到与人类视觉相当的水平。然而,DNN 是如何实现这一目标的,以及它们是否遵循 Marr 的 2D--2.5D--3D 构建理论,仍未得到探讨。本文深入感知任务,寻找这些问题的答案,并发现证据支持 Marr 的理论。我们引入一种图形探针,即一个子网络,用于从网络的中间层重构原始图像。图形探针的关键在于其灵活的架构,支持 2D 和 3D 格式的图像,以及它们之间的过渡状态。通过将图形探针注入神经网络并分析其重构图像的行为,我们发现 DNN 在低层级最初将图像编码为 2D 表示,在高层级最终构建 3D 表示。令人惊讶的是,在中层级,DNN exhibits 一种混合状态,即在狭窄的深度范围内构建几何表示,类似于低凸面雕塑的外观。这一阶段类似于 2.5D 表示,揭示了 DNN 在感知过程中如何从 2D 演变为 3D。因此,图形探针作为一种探窥 DNN 机制的工具,为 Marr 的理论提供了实证支持。
引用
@article{arxiv.2411.16148,
title = {Revisiting Marr in Face: The Building of 2D--2.5D--3D Representations in Deep Neural Networks},
author = {Xiangyu Zhu and Chang Yu and Jiankuo Zhao and Zhaoxiang Zhang and Stan Z. Li and Zhen Lei},
journal= {arXiv preprint arXiv:2411.16148},
year = {2024}
}