中文

零样态世界模型是发展高效的学习者

人工智能 2026-04-14 v1 计算机视觉与模式识别

摘要

幼儿园儿童表现出理解其物理世界的早期能力,估计深度、运动、物体连贯性、相互作用以及许多其他物理场景理解方面的能力。儿童既在数据效率方面又在灵活性方面都是高效的认知系统,尽管训练数据极其有限,仍能创建能力,同时对众多未训练的任务进行泛化——这仍是当今最佳AI系统面临的主要挑战。我们提出了一种新的计算假设来解释这些能力,称为零样态视觉世界模型(ZWM)。ZWM基于三个原则:稀疏时序分解的预测器,用于分离外观和动力学;通过近似因果推断的零样态估计;以及推断的组合以构建更复杂的能力。我们展示,ZWM可以从单个儿童的第一人称经验中学习,快速在多个物理理解基准测试中生成能力。它也广泛再现了儿童发展行为特征,构建类脑的内部表征。我们的工作为从人类规模数据中实现高效和灵活的学习,推进了两种认知儿童早期物理理解的计算模型以及通往数据高效AI系统的道路。

关键词

引用

@article{arxiv.2604.10333,
  title  = {Zero-shot World Models Are Developmentally Efficient Learners},
  author = {Khai Loong Aw and Klemen Kotar and Wanhee Lee and Seungwoo Kim and Khaled Jedoui and Rahul Venkatesh and Lilian Naing Chen and Michael C. Frank and Daniel L. K. Yamins},
  journal= {arXiv preprint arXiv:2604.10333},
  year   = {2026}
}