从儿童视角的视频表示自监督学习
计算机视觉与模式识别
2024-10-18 v3 机器学习
神经与进化计算
神经元与认知
摘要
儿童从几年的自我中心视觉经验中学习到了关于周围世界的强大内部模型。这种内部模型能否通过高度通用的学习算法从儿童的视觉经验中学习到,还是它们需要强归纳偏置?在收集大规模、纵向、发育逼真的视频数据集和通用自监督学习 (SSL) 算法方面的最新进展,正使我们开始着手解决这一先天与后天的问题。然而,现有工作通常侧重于基于图像的 SSL 算法和可从静态图像中学习到的视觉能力(例如物体识别),从而忽略了世界的时间特性。为了弥补这一差距,我们在儿童早期发育期间(6-31 个月)收集的纵向、自我中心头戴式摄像机记录上训练了自监督视频模型。由此产生的模型在从少量标注样本中促进动作概念学习方面非常有效;它们具有良好的数据规模扩展特性;并且它们表现出涌现的视频插值能力。与使用完全相同数据训练的基于图像的模型相比,视频模型还学习到了更准确、更鲁棒的物体表示。这些结果表明,儿童内部世界模型的重要时间特性可以通过高度通用的学习算法从其视觉经验中学习到,而无需强归纳偏置。
引用
@article{arxiv.2402.00300,
title = {Self-supervised learning of video representations from a child's perspective},
author = {A. Emin Orhan and Wentao Wang and Alex N. Wang and Mengye Ren and Brenden M. Lake},
journal= {arXiv preprint arXiv:2402.00300},
year = {2024}
}
备注
v3 updates results with significantly improved models; v2 was published as a conference paper at CogSci 2024; code & models available from https://github.com/eminorhan/video-models