中文

CoLLIE:基于语言-图像嵌入的持续语言接地学习

计算与语言 2022-07-12 v3

摘要

本文提出CoLLIE:一种简单而有效的持续学习语言如何在视觉中接地的模型。给定一个预训练的多模态嵌入模型,其中语言与图像被投影至同一语义空间(本例中为OpenAI的CLIP),CoLLIE学习一个变换函数,在需要时调整语言嵌入以适应新的语言用法。这是通过预测需施加的差分向量以及该向量的缩放因子来实现的,从而仅在需要时进行调整。与传统少样本学习不同,该模型不仅学习新类别与标签,还能泛化至相似语言用法并利用语义组合性。我们在两项不同的识别指代表达式目标的任务上验证了模型性能,其中模型须学习新的语言用法。结果表明该模型能从极少样本中高效学习并泛化,且对模型原有的零样本性能干扰很小。

关键词

引用

@article{arxiv.2111.07993,
  title  = {CoLLIE: Continual Learning of Language Grounding from Language-Image Embeddings},
  author = {Gabriel Skantze and Bram Willemsen},
  journal= {arXiv preprint arXiv:2111.07993},
  year   = {2022}
}

备注

Published in Journal of Artificial Intelligence Research (JAIR)