中文

模型从文本之外的训练中习得什么?度量视觉常识知识

计算与语言 2022-05-17 v1

摘要

仅从文本中学习语言存在局限性。因此,近来的研究焦点转向开发多模态模型。然而,能够度量语言模型从多模态训练中学到了哪些语言知识的基准甚少。我们假设,在视觉模态上训练应当提升语言模型中的视觉常识知识。为此,我们引入两项用于度量语言模型中视觉常识知识的评测任务,并用它们评估不同的多模态模型与单模态基线。主要发现是,在视觉文本数据上训练的多模态模型与单模态基线模型之间的视觉常识知识并无显著差异。

关键词

引用

@article{arxiv.2205.07065,
  title  = {What do Models Learn From Training on More Than Text? Measuring Visual Commonsense Knowledge},
  author = {Lovisa Hagström and Richard Johansson},
  journal= {arXiv preprint arXiv:2205.07065},
  year   = {2022}
}

备注

Accepted to the ACL Student Research Workshop 2022