中文

World-to-Words:视觉语言模型中通过快速映射实现接地开放词汇习得

计算与语言 2024-12-30 v2 人工智能 计算机视觉与模式识别

摘要

将语言单元与其在物理世界中的指称对象相连接的能力,被称为接地(grounding),对学习并理解词的接地意义至关重要。尽管人类在新词学习中表现出快速映射,但现代视觉语言模型是否真能以接地意义表征语言、以及接地如何进一步引导新词学习仍不明确。为此,我们引入接地开放词汇习得(GOVA)以考察开放世界语言学习中的接地与引导。作为初步尝试,我们提出面向对象的BERT(OctoBERT),一种新颖的视觉接地语言模型,通过在图文对上预训练并将接地作为目标来构建。通过大量实验与分析,我们证明OctoBERT是一个更连贯且快速的接地词学习者,且预训练期间获得的接地能力有助于模型更迅速、稳健地学习未见词。我们的代码见 https://github.com/sled-group/world-to-words

关键词

引用

@article{arxiv.2306.08685,
  title  = {World-to-Words: Grounded Open Vocabulary Acquisition through Fast Mapping in Vision-Language Models},
  author = {Ziqiao Ma and Jiayi Pan and Joyce Chai},
  journal= {arXiv preprint arXiv:2306.08685},
  year   = {2024}
}

备注

ACL 2023 Outstanding Paper