中文

照护者言语塑造幼儿视觉:二元游戏的计算研究

计算机视觉与模式识别 2024-01-18 v2 人工智能 机器学习

摘要

婴儿识别与分类物体的能力是逐步发展的。生命的第二年既标志着更具语义性的视觉表征的出现,也标志着对词义理解的提升。这表明语言输入可能在塑造视觉表征方面发挥重要作用。然而,即便在像二元游戏(dyadic play)这样的适合词汇学习的语境中,照护者的言语仍然稀疏且具有歧义,常常指代与儿童所注意物体不同的对象。在本文中,我们系统地研究了照护者的言语在何种程度上仍能增强视觉表征。为此,我们提出了一个二元游戏中视觉表征学习的计算模型。我们引入了一个由幼儿智能体(toddler-agent)感知到的合成自我中心图像数据集,该智能体在其家庭环境的不同位置移动并旋转玩具物体,同时听到被建模为字幕(captions)的照护者言语。我们提出将幼儿的学习建模为同时对以下两类表征进行对齐:1) 时间上接近的图像;2) 同时出现的图像与言语。我们证明,具有与真实照护者相匹配的统计特性的言语能够产生支持更优类别识别能力的表征。我们的分析揭示,物体相关命名频率的微小增减会显著影响所学表征。这会影响对语句中物体名称的注意力,而这种注意力对于有效的视觉-语言对齐是必需的。总体而言,我们的结果支持如下假设:照护者的命名言语能够改善幼儿的视觉表征。

关键词

引用

@article{arxiv.2312.04118,
  title  = {Caregiver Talk Shapes Toddler Vision: A Computational Study of Dyadic Play},
  author = {Timothy Schaumlöffel and Arthur Aubret and Gemma Roig and Jochen Triesch},
  journal= {arXiv preprint arXiv:2312.04118},
  year   = {2024}
}

备注

Proceedings of the 2023 IEEE International Conference on Development and Learning (ICDL)