层次抽象实现深度学习模型中的类人 3D 对象识别
计算机视觉与模式识别
2025-07-15 v1 机器学习
摘要
人类和深度学习模型都可以从稀疏的三维信息(例如,从 3D 对象的表面随机抽取的点集,称为点云)中识别对象。尽管深度学习模型在从 3D 形状识别对象方面实现了类人水平,但这些模型是否发展出类似于人类视觉用于对象识别的 3D 形状表征仍不清楚。我们假设,训练 3D 形状可使模型形成 3D 形状中局部几何结构的表征。然而,这些模型对全局 3D 对象形状的表征可能有限。我们进行了两项人类实验,系统性地操控点密度和对象姿态(实验 1),以及局部几何结构(实验 2)。在所有实验条件下,人类始终表现良好。我们将两种类型的深度学习模型进行比较:一种基于卷积神经网络(DGCNN),另一种基于视觉变换器(point transformer),并与人类表现进行比较。我们发现,基于视觉变换器的点转换模型比基于卷积的模型更能解释人类表现。这种优势主要来自点转换模型支持 3D 形状层次抽象的机制。
引用
@article{arxiv.2507.09830,
title = {Hierarchical Abstraction Enables Human-Like 3D Object Recognition in Deep Learning Models},
author = {Shuhao Fu and Philip J. Kellman and Hongjing Lu},
journal= {arXiv preprint arXiv:2507.09830},
year = {2025}
}