中文

仿照人类发展视觉饮食构建稳健、基于形状的AI视觉系统

机器学习 2026-03-10 v3 计算机视觉与模式识别

摘要

尽管多年来研究不断推进,人工智能(AI)系统的视觉能力仍与人类存在显著差异。与人类不同,AI依赖纹理特征而非形状信息,难以对图像失真保持鲁棒性,对对抗性攻击极其脆弱,且在复杂背景下识别简单抽象形状仍具挑战。为弥合这一差距,本文致力于从婴儿早期视觉发展到成年人的发展过程着手。我们将数十年研究成果综合为一种新型的发展视觉饮食(DVD),指导AI系统通过人类式的课程训练,产生更符合人类行为的视觉模型。考虑到视觉分辨率、对比度灵敏度和颜色的发展,本文所提出的课程训练模型在所有鲁棒视觉测试指标上均表现出人类行为的对齐,实现了迄今为止最强的形状依赖程度、超越当前最佳状态的抽象形状识别,以及对图像失真和对抗性攻击的更高鲁棒性。我们的结果表明,稳健的AI视觉能力可以通过引导模型的学习方式实现,而不仅仅是学习量的增加,为通向更安全、更符合人类的人工视觉系统提供了资源高效的路径。

关键词

引用

@article{arxiv.2507.03168,
  title  = {Adopting a human developmental visual diet yields robust, shape-based AI vision},
  author = {Zejin Lu and Sushrut Thorat and Radoslaw M Cichy and Tim C Kietzmann},
  journal= {arXiv preprint arXiv:2507.03168},
  year   = {2026}
}