儿童视角下物体的视觉表征特征
计算机视觉与模式识别
2026-05-15 v1
摘要
儿童在早期几年内从日常生活中获取物体类别表征。这些学习过程的输入究竟是什么样的?我们分析了来自 BabyView 数据集中(N=31 名参与者,868 小时,年龄 5-36 个月)的儿童一人称视频,使用监督对象检测模型从超过 300 万帧中提取常见物体类别。我们发现,儿童的物体类别暴露高度倾斜:仅有少数类别(如杯子、椅子)主导了儿童的视觉经验,而大多数类别很少出现,这复制了来自更受限制情境的先前研究 findings。类别范例高度可变:儿童遇到来自异常角度、高度杂乱场景和部分遮挡视图的对象;许多类别(尤其是动物)最常以图示形式出现。令人惊讶的是,尽管存在这种变异性,检测到的类别(如长颈鹿、苹果)相对于来自这些类别规范照片的检测结果,在上等类别(如动物、食物)内部显示出更强的聚类。我们在使用来自自监督视觉和多模态模型的高维嵌入时,发现了相同的模式;这一效应也在来自单个儿童的密集采样数据中得到复现。理解视觉类别学习的鲁棒性和效率将需要开发能够利用强上等结构并从非规范、稀疏和可变范例中学习的模型。
引用
@article{arxiv.2605.14990,
title = {Characterizing the visual representation of objects from the child's view},
author = {Jane Yang and Tarun Sepuri and Alvin Wei Ming Tan and Khai Loong Aw and Michael C. Frank and Bria Long},
journal= {arXiv preprint arXiv:2605.14990},
year = {2026}
}
备注
19 pages, 6 figures