中文

婴儿通过视觉习得的概念可贡献于AI模型的视觉学习与理解

人工智能 2026-03-27 v3 神经与进化计算

摘要

在发育早期,婴儿学会了从视觉场景中提取出奇地复杂的方面。这种早期学习伴随着对所提取概念的初步理解,例如它们的含义、因果关系,以及利用它们来预测可能发生的未来事件。在许多情况下,这种学习是在极少或完全没有监督的情况下获得的,与当前的网络模型相比,仅需相对较少的样本。早期发展过程中视觉感知的实证研究表明,在物体和人类-物体交互领域,早期习得的概念通常用于学习后续更复杂的概念。在当前工作中,我们建模了早期习得的概念如何用于后续概念的学习,并将结果与标准深度网络建模进行了比较。我们特别关注在动态视觉场景中学习预测未来事件时能动性概念和目标归因概念的使用。我们表明,在新概念的学习中使用早期概念能够带来更好的学习(更高的准确率)和更高效的学习(需要更少的数据),并且早期概念与新概念的组合塑造了模型习得的概念的表示并改善了其泛化能力。我们进一步将先进的视觉语言模型与一项需要理解能动体与非能动体行为差异的人类研究进行了对比,结果支持早期概念对视觉理解的贡献。最后,我们简要讨论了将人类类视觉学习的各个方面融入计算机视觉模型的可能益处。

关键词

引用

@article{arxiv.2503.03361,
  title  = {Concepts Learned Visually by Infants Can Contribute to Visual Learning and Understanding in AI Models},
  author = {Shify Treger and Shimon Ullman},
  journal= {arXiv preprint arXiv:2503.03361},
  year   = {2026}
}

备注

Significantly extended version of earlier work, with additional experiments, expanded discussion and related work, new experiments with human participants, and broader evaluation across multiple vision-language models