中文

视觉是否能加速神经语言学习器的层级泛化?

计算与语言 2024-12-18 v3

摘要

从语言习得的角度看,神经语言模型(LMs)的数据效率可以说不如人类。一个根本性的问题是,这种人类与 LM 之间的差距因何而生。本研究探讨了具身语言习得的优势,具体而言是视觉信息(人类在语言习得中通常可依赖而 LM 大多无法获取)对 LM 句法泛化的影响。我们的实验遵循刺激贫乏范式,在两种情境下(使用人工图像与自然图像)进行,表明若语言与视觉成分在输入中的对齐清晰,则获取视觉数据确实有助于 LM 的句法泛化,否则视觉输入无益。这凸显了需要额外的偏置或信号(如共同注视)来增强跨模态对齐,并实现多模态 LM 中的高效句法泛化。

关键词

引用

@article{arxiv.2302.00667,
  title  = {Does Vision Accelerate Hierarchical Generalization in Neural Language Learners?},
  author = {Tatsuki Kuribayashi and Timothy Baldwin},
  journal= {arXiv preprint arXiv:2302.00667},
  year   = {2024}
}

备注

COLING 2025; 15 pages