从婴儿眼中看见:早期视觉饮食构成人类与机器的鲁棒视觉智能
计算机视觉与模式识别
2026-03-25 v2
摘要
新生儿的视觉呈现低分辨率、色彩减退且持续的时间性特征,这些特征随着婴儿发育逐渐锐化。为探索此类分阶段“视觉饮食”所蕴含的生态优势,我们在模拟婴儿视觉约束下的对象中心视频上进行自监督学习(SSL)训练,这些约束包括灰度到彩色(C)、模糊到锐利(A)以及保持时间连续性(T)——统称为 CATDiet。为进行评估,我们在十个数据集上建立了全面的基准,涵盖干净和损坏图像识别、纹理-形状线索冲突测试、轮廓识别、深度序分类以及视觉崩溃范例。所有 CATDiet 变体在对象识别中均显示出增强的鲁棒性,尽管其仅在对象中心视频上进行训练。惊人的是,模型也表现出与生物学发育模式相吻合的特征,包括类似灵长类 V1 区突触密度的神经可塑性变化以及类似婴儿视觉崩溃反应的行为。基于这些洞见,CombDiet 在标准训练前初始化 SSL,同时保持时间连续性。在对象中心视频或头戴式婴儿视频上训练的 CombDiet 在域内和域外对象识别以及深度感知方面均优于标准 SSL。总体而言,这些结果表明,早期婴儿视觉经验的发展进程为理解机器视觉智能的出现提供了一种强大的逆向工程框架。所有代码、数据和模型均已在 Github 上提供。
引用
@article{arxiv.2511.14440,
title = {Learning to See Through a Baby's Eyes: Early Visual Diets Enable Robust Visual Intelligence in Humans and Machines},
author = {Yusen Cai and Qing Lin and Bhargava Satya Nunna and Mengmi Zhang},
journal= {arXiv preprint arXiv:2511.14440},
year = {2026}
}