中文

利用多模态语言模型评估婴儿视觉与语言经验的对齐性

计算机视觉与模式识别 2025-11-25 v1 计算与语言

摘要

弄清楚哪些对象或概念的词语指指不定是年幼儿童语言学习的核心挑战之一。大多数模型假设儿童会从与他们周围说话的人讨论对象时的词语及其指涘同时出现的情形中学习早期对象标签。但这些时刻在时间上对齐的情况如何?迄今为止,由于需要对视觉-语言共现进行耗时的手动标注,此问题的答案仍受限。本文评估了对比语言-图像预训练 (CLIP) 模型用于自动表征以婴儿视角拍摄的户外视频中视觉-语言对齐性的可行性。我们通过人类对齐判断验证了 CLIP 对齐得分的有效性,然后将该指标应用于大型婴儿视角视频语料库。我们表明,为学习而言的理想对齐时刻(例如“看看这个球”伴随球体出现在孩子视野中)在儿童日常经验中相对稀少,与现代机器学习数据集相比;并在儿童之间以及单个儿童内部突显对齐性的变异性。这些发现表明,对齐频率不足是描述早期词语学习模型的约束,并提供了一种新方法用于探讨儿童多模态环境。

关键词

引用

@article{arxiv.2511.18824,
  title  = {Assessing the alignment between infants' visual and linguistic experience using multimodal language models},
  author = {Alvin Wei Ming Tan and Jane Yang and Tarun Sepuri and Khai Loong Aw and Robert Z. Sparks and Zi Yin and Virginia A. Marchman and Michael C. Frank and Bria Long},
  journal= {arXiv preprint arXiv:2511.18824},
  year   = {2025}
}