极粗糙反馈信号足以学习人类一致的视觉表征
偏微分方程分析
2026-05-13 v2
摘要
人工神经网络在视觉任务上训练后会发展出类似灵长类动物视觉系统的内部表征,这一发现已指导了十年的计算神经科学。关于构建脑对齐模型的研究正逐渐拥抱更细粒度的监督信号,从对象分类到对比自监督目标,以最大化单个图像之间的差异,但关于监督信号粗细度对脑对齐性的作用仍在很大程度上未被检讨。本文我们系统性地检验了学习信号的粗细度如何塑造表征与人类视觉的对齐。我们通过数据驱动的方法,对训练图像进行分层,將其划分为 2、4、8、16、...、64 个类别,通过对预训练嵌入进行 PCA 分割来实现。我们在卷积和 transformer 架构上训练了数百个神经网络,并将其表征与猴科动物电生理记录和人类 fMRI 响应进行比较。我们发现,仅能区分 8 个宽泛类别的网络就能学习出与区分 1000 类的模型相当乃至更好的神经对齐性。更令人惊讶的是,这些粗糙训练的网络与人类感知相似性判断的对齐程度超过了所有其他模型,包括在粗粒度监督或自监督训练的网络以及领先的大规模视觉模型。这些结果表明,惊人的粗糙反馈就足以产生类人视觉表征,重新定义了视觉学习所需的信号,为构建更贴合人类感知的 AI 系统指明了道路。
引用
@article{arxiv.2605.05555,
title = {Notes on Liouville-type theorems for the 3D stationary Navier-Stokes equations},
author = {Hongling Jiang and Jianfeng Sun and Gastón Vergara-Hermosilla and Jihong Zhao},
journal= {arXiv preprint arXiv:2605.05555},
year = {2026}
}
备注
9 pages