中文

通过儿童中心主观输入建模 grounded 词汇学习的鲁棒性研究

计算与语言 2026-01-09 v2

摘要

机器学习能为理解人类语言习得提供哪些启发?大型语言和多模态模型已取得显著能力,但其对海量训练数据的依赖与儿童形成的根本性差异——儿童能够从相对有限的输入中成功习得语言。为弥合这一差距,研究者日益采用类似儿童输入数量和质量的数据训练神经网络。将这一方法推向极限,Vong 等人 (2024) 表明,仅基于单个儿童发展经历中提取的 61 小时视觉和语言输入训练的多模态神经网络,即可获得词汇指称映射。然而,这种方法的成功是否反映了单个儿童经历的独特性,或是否在多个儿童经历中展现出一致且稳健的学习模式,尚未被探讨。本文应用自动语音转录技术,对整个 SAYCam 数据集进行处理——该数据集涵盖所有三位儿童的 500 小时以上视频数据。通过这些自动转录,我们生成了用于训练和评估的多模态视觉语言数据集,并探索了多种神经网络配置,以检验模拟词汇学习的鲁棒性。我们的发现表明,针对每位儿童自动转录数据训练的网络能够获得词汇指称映射,能够在视频、儿童和图像领域进行泛化。这些结果验证了多模态神经网络在 grounded 词汇学习中的稳健性,同时突显了在每位儿童发展经历中学习时所出现的个体差异。

关键词

引用

@article{arxiv.2507.14749,
  title  = {On the robustness of modeling grounded word learning through a child's egocentric input},
  author = {Wai Keen Vong and Brenden M. Lake},
  journal= {arXiv preprint arXiv:2507.14749},
  year   = {2026}
}